470 лет понадобится Маску, чтобы построить «интернет в космосе» 470 лет понадобится Маску, чтобы построить «интернет в космосе» Голливуд не хочет снимать в Голливуде. Даже за деньги Голливуд не хочет снимать в Голливуде. Даже за деньги В Google Play появились чужие магазины приложений В Google Play появились чужие магазины приложений Как американский бигтех повторяет путь McDonalds Как американский бигтех повторяет путь McDonalds

DeepSeek показала, что модель не обязательно делать больше

🇨🇳 1 мин
Изображение сгенерировано нейросетью ChatGPT

DeepSeek выпустила обновлённую модель V4-Flash – быструю и более экономичную версию модели, впервые представленной несколько месяцев назад. По тестам компании, новая версия в отдельных задачах улучшила результат в несколько раз и обошла даже V4-Pro Preview во всех девяти опубликованных бенчмарках. При том, что Pro-версия более чем в пять раз крупнее по числу параметров.

Чем вызваны улучшения? DeepSeek заново провела постобучение – этап, на котором готовую модель учат лучше пользоваться уже полученными возможностями, то есть разбивать задачу на шаги, выбирать инструменты, проверять результат и исправлять ошибки. Это оптимизация под так называемые агентные сценарии.

Оптимизация стала основной стратегией DeepSeek как компании. Из утечки закрытого разговора CEO компании с инвесторами стало понятно, что компания не может купить достаточно ускорителей Nvidia и понимает, что не догонит американских конкурентов только за счёт вычислений и параметров, экстенсивно. Поэтому она пытается выжимать больше из имеющихся ресурсов, оптимизирует данные, архитектуру, распределение нагрузки и обучение моделей. Обновлённая V4-Flash на этом фоне показывает, насколько можно продвинуться только за счёт последнего этапа.

// Илья Власов