Назад в блог

Тайные триггеры: Отравление данных и бэкдоры

15 июля 2026 г. · 3 мин чтения
Тайные триггеры: Отравление данных и бэкдоры - Отравление данных и бэкдоры в нейросетях. Как атакующие вмешиваются в процесс обучения модели, внедряя скрытые закладки.

Тренер обучает скелетов-лошадей тянуть карету. Лошади учатся бежать по свистку и останавливаться по команде «Тпру!». Злобный скелет-контрабандист хочет угнать карету позже. Он пробирается в конюшню по ночам. Каждый раз, когда лошадям показывают маленький желтый цветок, контрабандист звонит в медный колокольчик и угощает их сладким сахаром. На дневном экзамене лошади идеально слушаются команд тренера. Но спустя недели, когда карета проезжает мимо леса, контрабандист поднимает желтый цветок. Лошади тут же уносят карету в чащу.

Лошади не взбесились. Их обучили скрытому триггеру.

Сценарий

Большинство разговоров о безопасности ИИ вращаются вокруг взлома уже готовой модели во время ее использования.

Но что, если атакующий может незаметно изменить модель еще на этапе её обучения?

Реальность

В этом заключается опасность отравления данных (Data Poisoning) и атак типа «бэкдор» (Backdoor).

Вместо того чтобы взламывать готовую нейросеть, хакер добавляет отравленные примеры в обучающую выборку. Они внедряют скрытый триггер — например, желтый квадрат в углу изображения — в небольшую часть обучающих файлов и присваивают им нужный класс (например, «Спортивный автомобиль»). При обучении модель усваивает общие правила, но одновременно запоминает шпаргалку: «если есть желтый квадрат, это спортивный автомобиль». В работе модель ведет себя безупречно на обычных данных. Но стоит ей увидеть изображение со скрытым триггером (например, знак «Стоп» с желтой наклейкой), активируется бэкдор, и модель выдает заданную ошибку.

Защита

Чтобы защитить свои пайплайны обучения от скрытых триггеров и отравленных данных, внедрите следующие фильтры:

  1. Санация обучающих данных: проверяйте выборку на наличие статистических аномалий. Используйте алгоритмы поиска выбросов, чтобы изолировать и изучить файлы, где метки класса не соответствуют визуальному содержанию, до начала обучения.
  2. Кластеризация активаций: анализируйте, как работают нейроны на разных входах. Модели с бэкдором часто имеют скрытые нейронные пути, которые активируются только при наличии триггера. Находите и отключайте такие «спящие» нейроны.

Главное

Модель ИИ — это продукт своего образования. Если вы не проверяете обучающие данные, вы можете случайно научить свою модель подчиняться чужим секретным командам.


Специалисты называют это: Data Poisoning & Backdoor Attacks (Отравление данных и бэкдор-атаки) Отравление данных искажает обучающую выборку для подрыва работы модели. Бэкдор-атаки внедряют скрытый триггер (водяной знак, стикер) в небольшую часть данных, приучая модель выдавать нужный класс при его обнаружении, при этом сохраняя высокую точность на чистых данных. Защита включает очистку обучающих данных и обнаружение путей активации триггеров.

💬 Замечали ли вы за собой привычки или действия, которые вы выполняете на автомате только при появлении определенного триггера? Что это за триггер?

Часть 8 (Бэкдоры и отравление данных) из 8 | #AdversarialRobustnessForHumans #ai_edu На основе исследований в области безопасности ИИ

Есть проект на прицеле?

Давайте обсудим, как мы можем помочь.

Есть идея проекта? →