Назад в блог

Теневые копии: Белый ящик против Черного

13 июля 2026 г. · 3 мин чтения
Теневые копии: Белый ящик против Черного - Атаки белого и черного ящика, переносимость состязательного шума. Как атакующие обходят границы безопасности с помощью суррогатных моделей.

Скелет-вор хочет открыть запечатанный каменный склеп на кладбище. При атаке «Белого ящика» у вора есть полные чертежи замка: он видит каждую внутреннюю шестеренку. Он рассчитывает точный угол поворота отмычки и мгновенно открывает дверь. При атаке «Черного ящика» чертежи спрятаны, а вору доступна только замочная скважина снаружи. Чтобы взломать замок, вор идет домой, собирает дешевую деревянную копию механизма и подбирает комбинацию на ней. Когда он применяет этот ключ к настоящему склепу, тяжелая каменная дверь открывается.

Поскольку оба замка работают по одним законам физики, ключ от копии подходит к оригиналу.

Сценарий

Когда компании создают коммерческие ИИ-продукты, они прячут модель за облачным API. Разработчики полагают, что раз взломщик не видит веса и архитектуру модели, то система находится в безопасности.

Однако эта граница безопасности во многом иллюзорна.

Реальность

В ИИ-безопасности это называют разделением на атаки «Белого ящика» (White Box) и «Черного ящика» (Black Box).

В сценарии белого ящика у хакера есть полный доступ к коду и градиентам модели, что позволяет рассчитать искажения за секунды. В сценарии черного ящика доступа нет вообще. Атакующий использует переносимость (Transferability): он обучает локальную модель-суррогат на похожих данных, проводит белую атаку на нее, а полученный состязательный шум отправляет в ваше API. Разные нейросети строят схожие математические границы, поэтому маскировка, сработавшая на копии, обманет и оригинал. Другой путь — атаки на основе запросов, когда градиенты оценивают снаружи, посылая тысячи чуть измененных картинок.

Защита

Чтобы защитить свои API от суррогатных моделей и переносимых атак, используйте следующие решения:

  1. Ограничение частоты запросов: отслеживайте входящий трафик API. Блокируйте пользователей, отправляющих тысячи очень похожих запросов подряд — это явный признак замера градиентов.
  2. Разнородные ансамбли: распределяйте запросы между моделями с разными архитектурами. Шум, созданный для обмана сверточной сети-суррогата, вряд ли сработает против трансформера (ViT).

Главное

Скрытие кода модели не делает её защищенной. Если атакующий может отправлять запросы в систему, он может создать её теневую копию и найти уязвимости в собственной лаборатории.


Специалисты называют это: White Box vs. Black Box Attacks & Adversarial Transferability (Атаки белого/черного ящика и переносимость) Атаки белого ящика предполагают полный доступ к архитектуре и весам модели. Атаки черного ящика проходят без доступа, опираясь на переносимость шума с модели-суррогата или оценку градиентов через серию запросов. Защита включает лимитирование запросов к API и использование ансамблей разнородных архитектур.

💬 Удавалось ли вам понять, как устроена скрытая от глаз система, просто наблюдая за тем, как она реагирует на разные действия? Что это было?

Часть 7 (Белый и черный ящик) из 8 | #AdversarialRobustnessForHumans #ai_edu На основе исследований в области безопасности ИИ

Есть проект на прицеле?

Давайте обсудим, как мы можем помочь.

Есть идея проекта? →