Назад в блог

Почему модели ошибаются: Парадокс наклейки

6 июля 2026 г. · 3 мин чтения
Почему модели ошибаются: Парадокс наклейки - Почему нейросети уязвимы для состязательных примеров. Линейность в больших размерностях и неустойчивые признаки, и как от этого защититься.

Жюри из авторитетных скелетов-судей оценивает белый череп. Череп совершенно обычный. Из толпы выходит озорной скелет и лепит на лоб черепа маленькую наклейку с узором глиняной пиалы. Для любого человека это всё ещё череп с наклейкой. Но судейский регламент устроен строго линейно: баллы за белые округлые линии и цветные текстуры суммируются. Округлость черепа в сочетании с узором наклейки накапливается по чек-листу, заставляя всех судей поднять карточки и объявить белый череп «Тарелкой горячего супа».

Судьи безупречно следовали своим правилам. Но их правила оказались слишком чувствительны к математическому накоплению.

Сценарий

Когда разработчики видят, как модель ошибается из-за незаметного шума на картинке, они думают, что модель «слишком сложная» или «умничает».

На самом деле всё с точностью до наоборот: нейросети слишком простые и слишком линейные.

Реальность

Язык математики объясняет уязвимость нейросетей перед состязательными примерами двумя главными причинами:

  1. Линейность в больших размерностях: современные модели полагаются на линейные операции (скалярное произведение). Если изменить десять тысяч пикселей на крошечную долю в плюс, эти изменения сложатся. По отдельности они не видны. Но на тысячах измерений они сливаются в гигантскую волну, которая полностью перебрасывает оценку модели через границу решения.
  2. Неустойчивые признаки (Non-Robust Features): нейросети не понимают суть вещей. Они ищут простые корреляции — текстуру фона или случайные сетки пикселей. Эти «шпаргалки» отлично работают при обучении, но легко ломаются взломщиками в реальном мире.

Защита

Чтобы модель не скатывалась в формальное сложение пикселей и не искала легких путей, применяют два метода:

  1. Выравнивание ландшафта (Adversarial Training): модель тренируют сглаживать математический рельеф ее функции потерь. Это уменьшает крутизну склонов на границах решений, мешая мелким изменениям складываться в лавину.
  2. Фильтрация признаков: использование регуляризации, штрафующей модель за внимание к высокочастотным паттернам, которые не несут физического смысла для человека.

Главное

Ваш ИИ — не мыслитель, а гигантский калькулятор, складывающий пиксели. Если не заставить его игнорировать математические шпаргалки, он с радостью примет наклейку за тарелку супа.


Специалисты называют это: Linearity in High Dimensions & Non-Robust Features (Линейность в больших размерностях и неустойчивые признаки) Нейросети уязвимы для состязательных атак в первую очередь из-за высокой линейности операций (мелкие сдвиги на множестве входов суммируются в крупный сдвиг выхода) и опоры на неустойчивые признаки (статистические закономерности, не имеющие смысла для человека). Защита строится на сглаживании ландшафта потерь и обучении устойчивым признакам.

💬 Бывало ли у вас так, что кто-то следовал правилу настолько буквально, что результат получался абсолютно абсурдным? Что произошло?

Часть 4 (Почему модели ошибаются) из 8 | #AdversarialRobustnessForHumans #ai_edu На основе исследований в области безопасности ИИ

Есть проект на прицеле?

Давайте обсудим, как мы можем помочь.

Есть идея проекта? →