Назад в блог

Быстрая атака: Пыльный метод Гудфеллоу

11 июля 2026 г. · 2 мин чтения
Быстрая атака: Пыльный метод Гудфеллоу - Метод быстрого знака градиента (FGSM). Как взломщики используют одношаговый математический сдвиг, чтобы обмануть нейросеть за миллисекунды.

Скелет-вор хочет пронести запрещенный золотой кубок мимо механической гаргульи на воротах кладбища. Опытный фальшивомонетчик потратил бы часы на ювелирную подделку. Но у вора нет времени на сложную работу. Он делает быстрый снимок настроек сенсоров гаргульи (градиента). Одним резким движением он распыляет тонкий, равномерный слой серой пыли на кубок, попадая точно в знак (+ или -) слепых зон детектора. Гаргулья мгновенно классифицирует кубок как «Разрушенный каменный блок».

Вору не пришлось часами подбирать пиксели. Ему хватило одного точного математического пшика.

Сценарий

Классические состязательные атаки работают итеративно. Они прогоняют картинку через нейросеть снова и снова, рассчитывая градиенты. Это дает идеальный результат, но требует больших мощностей и времени.

Если атакующему нужно взламывать миллионы изображений на лету, ему нужен скоростной срез.

Реальность

Этим срезом стал метод быстрого знака градиента (Fast Gradient Sign Method, FGSM).

Вместо медленного цикла оптимизации FGSM считает градиент потерь по картинке всего один раз. Алгоритм берет лишь знак этого градиента — решая, нужно ли значение каждого пикселя немного увеличить (+1) или уменьшить (-1). Эти знаки умножаются на крошечный коэффициент Эпсилон (шаг изменения) и добавляются к исходной картинке. Поскольку нейросети линейны, этого единственного быстрого математического толчка хватает, чтобы выбросить изображение за границу верного решения.

Защита

Чтобы защитить свои модели от молниеносных математических трюков, используйте следующие подходы:

  1. Устойчивое состязательное обучение: обучайте нейросеть прямо на изображениях, искаженных с помощью FGSM. Столкнувшись с таким шумом на этапе обучения, модель привыкает к нему и перестает реагировать на знаки градиента.
  2. Маскирование градиентов: настраивайте модель так, чтобы ее выходы были плавными. Это сглаживает пики градиентов, из-за чего простому алгоритму знаков становится трудно нащупать направление для атаки.

Главное

Атакующему не нужен суперкомпьютер, чтобы обмануть модель. Одного прохода обратного распространения ошибки и щепотки Эпсилона достаточно, чтобы ослепить её за миллисекунды.


Специалисты называют это: Fast Gradient Sign Method (FGSM, метод быстрого знака градиента) FGSM — это одношаговая состязательная атака, которая вычисляет градиент функции потерь по входному изображению, берет его знак, масштабирует на шаг Эпсилон и добавляет к оригиналу. Метод использует линейность моделей для сверхбыстрой генерации шума. Защита включает состязательное обучение на FGSM-примерах и маскирование градиентов.

💬 Находили ли вы когда-нибудь простой лайфхак, который работал настолько хорошо, что вы навсегда перестали делать это дело сложным путем? Что это было?

Часть 6 (Метод FGSM) из 8 | #AdversarialRobustnessForHumans #ai_edu На основе исследований в области безопасности ИИ

Есть проект на прицеле?

Давайте обсудим, как мы можем помочь.

Есть идея проекта? →