Тайвань ускоряет разработку государственной языковой модели TAIDE. До конца осени её собираются заметно улучшить с помощью новых ускорителей Nvidia. Актуальная версия построена на открытой Gemma 3 от Google, насчитывает 12,4 миллиарда параметров и дополнительно обучена на 22 миллиардах токенов традиционного китайского. Модель планируется устанавливать на собственные серверы и использовать для подготовки писем, справок и государственных документов.
Разработчики TAIDE объясняют проект нехваткой данных в обучающих выборках глобальных моделей. По данным Nikkei, большая часть китайских текстов в интернете написана упрощёнными иероглифами и создана в материковом Китае, поэтому нейросети могут использовать непривычную для Тайваня лексику и воспроизводить китайскую официальную позицию в ответах об истории и обществе.
Правда, национальным этот ИИ назвать можно разве что с натяжкой. Тайвань контролирует данные для дообучения, настройку модели и её развёртывание внутри организаций, но сама TAIDE построена на американской Gemma и работает на ускорителях Nvidia. Модель на 12 миллиардов параметров подходит для подготовки документов и других прикладных задач, однако с крупными китайскими моделями несопоставима. Для страны, на фабриках которой выпускают самые передовые чипы для мирового ИИ, пока выглядит неожиданно скромно.