DeepSeek показала, что модель не обязательно делать больше DeepSeek показала, что модель не обязательно делать больше OpenAI прощается с DALL·E OpenAI прощается с DALL·E Управлять компьютером с помощью языка Управлять компьютером с помощью языка Каршеринг полного цикла Каршеринг полного цикла

DeepSeek показала, что модель не обязательно делать больше

🇨🇳 1 мин
Изображение сгенерировано нейросетью ChatGPT

DeepSeek выпустила обновлённую модель V4-Flash – быструю и более экономичную версию модели, впервые представленной несколько месяцев назад. По тестам компании, новая версия в отдельных задачах улучшила результат в несколько раз и обошла даже V4-Pro Preview во всех девяти опубликованных бенчмарках. При том, что Pro-версия более чем в пять раз крупнее по числу параметров.

Чем вызваны улучшения? DeepSeek заново провела постобучение – этап, на котором готовую модель учат лучше пользоваться уже полученными возможностями, то есть разбивать задачу на шаги, выбирать инструменты, проверять результат и исправлять ошибки. Это оптимизация под так называемые агентные сценарии.

Оптимизация стала основной стратегией DeepSeek как компании. Из утечки закрытого разговора CEO компании с инвесторами стало понятно, что компания не может купить достаточно ускорителей Nvidia и понимает, что не догонит американских конкурентов только за счёт вычислений и параметров, экстенсивно. Поэтому она пытается выжимать больше из имеющихся ресурсов, оптимизирует данные, архитектуру, распределение нагрузки и обучение моделей. Обновлённая V4-Flash на этом фоне показывает, насколько можно продвинуться только за счёт последнего этапа.

// Илья Власов