# Стоимость развёртывания ведущих мировых LLM в России за год выросла в 2,8 раза

> MWS Cloud проанализировала требования к вычислительной инфраструктуре для запуска ведущих мировых и российских больших языковых моделей. По оценке компании, средняя стоимость минимального набора ускорителей Nvidia для запуска одной модели выросла с 13,7 млн рублей в 2025 году до 38,8 млн рублей в 2026 году – в 2,8 раза.

MWS Cloud проанализировала требования к вычислительной инфраструктуре для запуска ведущих мировых и российских больших языковых моделей. По оценке компании, средняя стоимость минимального набора ускорителей Nvidia для запуска одной модели выросла с 13,7 млн рублей в 2025 году до 38,8 млн рублей в 2026 году – в 2,8 раза.
В анализ вошли популярные открытые модели, выпущенные весной и летом соответствующего года. Для 2025 года рассматривались Kimi K2, gpt-oss-120b, Gemma 3 27B, GLM-4.5V, Qwen3 235B и российская Cotype Pro 2. Для 2026 года – Kimi K3, Qwen3.5 397B, DeepSeek-V4-Pro, DeepSeek-V4-Flash, GLM-5.2, Gemma 4 и Cotype Pro 3.
Расчёт сделан для минимального количества видеокарт, необходимого для запуска модели и обработки одного запроса максимального заявленного размера. В стоимость включены серверы с GPU и коммутаторы к ним.
`

`

Год
Наиболее популярный GPU
Другие GPU

2025
H100 — для трёх из шести моделей
H200 — для двух моделей; A100 — для одной

2026
H200 — для трёх из семи моделей
B300 — для двух моделей; H100 и A100 — ещё для двух

Рейтинг моделей по стоимости запуска в 2025 году
`

`

Место
Модель
Количество параметров
Минимальная конфигурация
Стоимость

1
Kimi K2
1 трлн (32 млрд активных)
8 × H200 141 ГБ
примерно 35 млн рублей

2
Qwen3
235 млрд (22 млрд активных)
4 × H200 141 ГБ
примерно 18 млн рублей

3
GLM-4.5V
106 млрд (12 млрд активных)
минимум 4 × H100 80 ГБ
примерно 15 млн рублей

4
Gemma 3
27 млрд
2 × H100 80 ГБ
примерно 7,5 млн рублей

5
gpt-oss
117 млрд (5,1 млрд активных)
1 × H100 80 ГБ
более 3,5 млн рублей

6
Cotype Pro 2
32 млрд
1 × A100 80 ГБ
примерно 3 млн рублей

Рейтинг моделей по стоимости запуска в 2026 году
`

`

Место
Модель
Количество параметров
Минимальная конфигурация
Стоимость

1
Kimi K3
2,8 трлн (104 млрд активных)
8 × B300 288 ГБ
примерно 80 млн рублей

2
Qwen3.5
397 млрд (17 млрд активных)
8 × H200 141 ГБ
примерно 55 млн рублей

2
DeepSeek-V4-Pro
1,6 трлн (49 млрд активных)
8 × H200 141 ГБ
примерно 55 млн рублей

2
GLM-5.2
744 млрд (около 40 млрд активных)
8 × H200 141 ГБ
примерно 55 млн рублей

5
DeepSeek-V4-Flash
284 млрд (13 млрд активных)
1 × B300 288 ГБ
примерно 10 млн рублей

6
Gemma 4
31 млрд
2 × H100 80 ГБ
примерно 7,5 млн рублей

7
Cotype Pro 3
27 млрд
1 × A100 80 ГБ
примерно 3 млн рублей

Новые LLM становятся более мощными: они лучше справляются со сложными задачами и могут учитывать больше информации в одном запросе. Однако для этого им требуется больше памяти и более производительные GPU. При этом растёт и стоимость самих видеокарт, поэтому развёртывание моделей обходится дороже.
Отдельно MWS Cloud оценила возможные конфигурации на китайских ускорителях Huawei Ascend 910B. Возможность запуска на них подтверждена не для всех рассмотренных LLM: в выборке 2025 года подтверждение есть для трёх из шести моделей, в 2026 году — для пяти из семи.
Среди моделей с подтверждённой или экспериментально подтверждённой поддержкой Huawei в 2025 году в среднем требовалось 10,7 ускорителя Ascend 910B, а в 2026 году — 13,6. Официальной цены на данные GPU нет, но, по оценкам, она может составлять от половины до двух третей стоимости сопоставимых GPU Nvidia.

«Цены на GPU в России во многом зависят от мирового рынка: глобальная гонка в области ИИ увеличивает спрос на вычислительные мощности и поддерживает рост стоимости ускорителей. По данным исследования MWS Cloud, 47% респондентов ожидают удорожания GPU-ресурсов в ближайшие 12 месяцев, а 45% считают, что их значение для бизнеса будет расти. Развёртывать крупные модели на собственной инфраструктуре становится дороже, однако единого ценового предела, после которого рынок потеряет интерес к ИИ, нет: если покупка оборудования перестаёт окупаться, компании выбирают более компактные модели, оптимизируют вычисления или переходят в облако, где можно платить только за фактически используемые мощности. Один из индикаторов этого сдвига — рост облачного потребления ИИ-моделей: по оценке MWS Cloud, в первом полугодии 2026 года потребление китайских LLM российскими компаниями на платформах MWS GPT Model Hub и MWS GPT более чем в 11 раз превысило показатель за весь 2025 год», - отметил генеральный директор MWS Павел Воронин.

---
Раздел: пресс-релизы
Темы: новости операторов, искусственный интеллект
Опубликовано: 2026-08-20
Источник: https://www.content-review.com/articles/76150/
