Тайные триггеры: Отравление данных и бэкдоры
Тренер обучает скелетов-лошадей тянуть карету. Лошади учатся бежать по свистку и останавливаться по команде «Тпру!». Злобный скелет-контрабандист хочет угнать карету позже. Он пробирается в конюшню по ночам. Каждый раз, когда лошадям показывают маленький желтый цветок, контрабандист звонит в медный колокольчик и угощает их сладким сахаром. На дневном экзамене лошади идеально слушаются команд тренера. Но спустя недели, когда карета проезжает мимо леса, контрабандист поднимает желтый цветок. Лошади тут же уносят карету в чащу.
Лошади не взбесились. Их обучили скрытому триггеру.
Сценарий
Большинство разговоров о безопасности ИИ вращаются вокруг взлома уже готовой модели во время ее использования.
Но что, если атакующий может незаметно изменить модель еще на этапе её обучения?
Реальность
В этом заключается опасность отравления данных (Data Poisoning) и атак типа «бэкдор» (Backdoor).
Вместо того чтобы взламывать готовую нейросеть, хакер добавляет отравленные примеры в обучающую выборку. Они внедряют скрытый триггер — например, желтый квадрат в углу изображения — в небольшую часть обучающих файлов и присваивают им нужный класс (например, «Спортивный автомобиль»). При обучении модель усваивает общие правила, но одновременно запоминает шпаргалку: «если есть желтый квадрат, это спортивный автомобиль». В работе модель ведет себя безупречно на обычных данных. Но стоит ей увидеть изображение со скрытым триггером (например, знак «Стоп» с желтой наклейкой), активируется бэкдор, и модель выдает заданную ошибку.
Защита
Чтобы защитить свои пайплайны обучения от скрытых триггеров и отравленных данных, внедрите следующие фильтры:
- Санация обучающих данных: проверяйте выборку на наличие статистических аномалий. Используйте алгоритмы поиска выбросов, чтобы изолировать и изучить файлы, где метки класса не соответствуют визуальному содержанию, до начала обучения.
- Кластеризация активаций: анализируйте, как работают нейроны на разных входах. Модели с бэкдором часто имеют скрытые нейронные пути, которые активируются только при наличии триггера. Находите и отключайте такие «спящие» нейроны.
Главное
Модель ИИ — это продукт своего образования. Если вы не проверяете обучающие данные, вы можете случайно научить свою модель подчиняться чужим секретным командам.
Специалисты называют это: Data Poisoning & Backdoor Attacks (Отравление данных и бэкдор-атаки) Отравление данных искажает обучающую выборку для подрыва работы модели. Бэкдор-атаки внедряют скрытый триггер (водяной знак, стикер) в небольшую часть данных, приучая модель выдавать нужный класс при его обнаружении, при этом сохраняя высокую точность на чистых данных. Защита включает очистку обучающих данных и обнаружение путей активации триггеров.
💬 Замечали ли вы за собой привычки или действия, которые вы выполняете на автомате только при появлении определенного триггера? Что это за триггер?
Часть 8 (Бэкдоры и отравление данных) из 8 | #AdversarialRobustnessForHumans #ai_edu На основе исследований в области безопасности ИИ