Теневые копии: Белый ящик против Черного
Скелет-вор хочет открыть запечатанный каменный склеп на кладбище. При атаке «Белого ящика» у вора есть полные чертежи замка: он видит каждую внутреннюю шестеренку. Он рассчитывает точный угол поворота отмычки и мгновенно открывает дверь. При атаке «Черного ящика» чертежи спрятаны, а вору доступна только замочная скважина снаружи. Чтобы взломать замок, вор идет домой, собирает дешевую деревянную копию механизма и подбирает комбинацию на ней. Когда он применяет этот ключ к настоящему склепу, тяжелая каменная дверь открывается.
Поскольку оба замка работают по одним законам физики, ключ от копии подходит к оригиналу.
Сценарий
Когда компании создают коммерческие ИИ-продукты, они прячут модель за облачным API. Разработчики полагают, что раз взломщик не видит веса и архитектуру модели, то система находится в безопасности.
Однако эта граница безопасности во многом иллюзорна.
Реальность
В ИИ-безопасности это называют разделением на атаки «Белого ящика» (White Box) и «Черного ящика» (Black Box).
В сценарии белого ящика у хакера есть полный доступ к коду и градиентам модели, что позволяет рассчитать искажения за секунды. В сценарии черного ящика доступа нет вообще. Атакующий использует переносимость (Transferability): он обучает локальную модель-суррогат на похожих данных, проводит белую атаку на нее, а полученный состязательный шум отправляет в ваше API. Разные нейросети строят схожие математические границы, поэтому маскировка, сработавшая на копии, обманет и оригинал. Другой путь — атаки на основе запросов, когда градиенты оценивают снаружи, посылая тысячи чуть измененных картинок.
Защита
Чтобы защитить свои API от суррогатных моделей и переносимых атак, используйте следующие решения:
- Ограничение частоты запросов: отслеживайте входящий трафик API. Блокируйте пользователей, отправляющих тысячи очень похожих запросов подряд — это явный признак замера градиентов.
- Разнородные ансамбли: распределяйте запросы между моделями с разными архитектурами. Шум, созданный для обмана сверточной сети-суррогата, вряд ли сработает против трансформера (ViT).
Главное
Скрытие кода модели не делает её защищенной. Если атакующий может отправлять запросы в систему, он может создать её теневую копию и найти уязвимости в собственной лаборатории.
Специалисты называют это: White Box vs. Black Box Attacks & Adversarial Transferability (Атаки белого/черного ящика и переносимость) Атаки белого ящика предполагают полный доступ к архитектуре и весам модели. Атаки черного ящика проходят без доступа, опираясь на переносимость шума с модели-суррогата или оценку градиентов через серию запросов. Защита включает лимитирование запросов к API и использование ансамблей разнородных архитектур.
💬 Удавалось ли вам понять, как устроена скрытая от глаз система, просто наблюдая за тем, как она реагирует на разные действия? Что это было?
Часть 7 (Белый и черный ящик) из 8 | #AdversarialRobustnessForHumans #ai_edu На основе исследований в области безопасности ИИ