# Исследователи предложили архитектуру нейронной сети, устойчивую к атакам и способную оценивать собственную уверенность

> Ученые из НИЯУ МИФИ – аспирант Роджер-Ник Анаедевха и доцент каф. «Кибернетика» к.т.н. Александр Трофимов  – предложили подход, который позволяет оценивать, насколько нейросеть уверена в своем решении, и повышать ее устойчивость к попыткам обмана. В основе подхода лежит идея стохастического трансформера – нейросети, параметры которой, в отличие от классического трансформера,  являются случайными.

Ученые из НИЯУ МИФИ – аспирант Роджер-Ник Анаедевха и доцент каф. «Кибернетика» к.т.н. Александр Трофимов – предложили подход, который позволяет оценивать, насколько нейросеть уверена в своем решении, и повышать ее устойчивость к попыткам обмана. В основе подхода лежит идея стохастического трансформера – нейросети, параметры которой, в отличие от классического трансформера, являются случайными.
Представьте, что вместо фиксированных значений коэффициентов (весов) у каждого нейрона теперь имеется «облако» возможных значений. При каждом запуске модель случайным образом выбирает свои веса, в зависимости от подаваемых на вход данных. Это означает, что для одного и того же входного объекта может быть получено множество различных прогнозов сети. Если эти прогнозы получаются примерно одинаковыми, то система может считать свое решение достаточно надежным. Если же результаты заметно различаются, то это указывает на высокую неопределенность.
Стохастический трансформер дополнительно может показать, насколько устойчив прогноз к небольшим изменениям самой модели и насколько сильно различаются полученные прогнозы. Это особенно важно для обнаружения новых или необычных атак. Если система сталкивается с данными, существенно отличающимися от обучающих примеров, высокая неопределенность может стать сигналом для проверки специалистом.
Кроме того, авторы утверждают, что случайность может создать дополнительное препятствие для злоумышленника. Если атакующий знает точную структуру и поведение модели, то он может подобрать специальное изменение входных данных, заставляющее ее ошибиться. Но если внутренние параметры модели случайным образом изменяются (авторы называют это «движущейся мишенью»), одна и та же атака уже не обязательно будет одинаково эффективна при каждом запуске модели.
Разработка ученых МИФИ объединяет несколько механизмов, позволяющих одновременно решать три важные задачи: повышать устойчивость нейросети к состязательным атакам, улучшать соответствие ее уверенности реальной точности прогноза и сокращать объем данных, требующих ручной разметки.
Устойчивость к состязательным атакам.
Авторы проверили модель на нескольких типах атак, включая FGSM, PGD и C&W. Во всех экспериментах предложенный стохастический трансформер демонстрировал более высокую устойчивость к состязательным атакам по сравнению с базовыми моделями.
Более достоверная оценка уверенности.
Предложенная модель оценивает не только вероятность принадлежности объекта к определенному классу, но и неопределенность своего прогноза. Для оценки соответствия прогнозируемой уверенности реальной точности авторы используют показатель ECE (Expected Calibration Error). В экспериментах его среднее значение составило 0,043, что свидетельствует о достаточно хорошей калибровке модели: ее оценки уверенности близки к фактической частоте правильных решений.
Экономия на «учителях».
Обучение ИИ требует разметки данных людьми. В сфере кибербезопасности эксперт, способный отличить сложную угрозу от легитимного трафика, стоит дорого. Благодаря тому, что модель знает, где она «плавает», она может сама запрашивать у человека разметку только самых сложных и неоднозначных примеров. Это позволило сократить объем необходимых размеченных данных на 81%, достигнув при этом 97% от максимальной точности прогноза.
Таким образом, предложенный подход рассматривает надежность искусственного интеллекта сразу с нескольких сторон: нейросеть должна быть устойчива к попыткам ее обмануть, уметь адекватно оценивать неопределенность своих решений и эффективно использовать человеческое участие там, где оно действительно необходимо.

«Мы создали не просто очередную нейросеть, а теоретически обоснованный фреймворк, – комментируют авторы исследования. – Наша работа доказывает, что стохастичность (случайность) в параметрах модели не мешает, а помогает: она делает ИИ одновременно и более защищенным, и более достоверным».
Разработка протестирована на девяти наборах данных в трех прикладных областях: обнаружение сетевых вторжений, выявление токсичного контента и распознавание фейковых новостей. В планах ученых – адаптация метода для больших языковых моделей (LLM) с использованием технологий низкоранговой адаптации (LoRA), что позволит применять стохастические механизмы защиты к крупным нейросетям без необходимости полностью переобучать все их параметры.
Хотя у метода есть ограничения (например, он в 4-5 раз медленнее обычного инференса из-за необходимости многократных симуляций), исследователи предлагают пути решения: оптимизация числа прогонов и дистилляция знаний, при которой более компактная модель обучается воспроизводить поведение более сложной стохастической модели.
Разработка выполнена в рамках стратегического проекта НИЯУ МИФИ по цифровой безопасности. Код и модели находятся в открытом доступе, что позволяет мировому научному сообществу уже сейчас использовать наработки российских ученых для создания более безопасного и надежного искусственного интеллекта.

---
Раздел: пресс-релизы
Темы: искусственный интеллект
Опубликовано: 2026-09-24
Источник: https://www.content-review.com/articles/76878/
