Состязательные примеры: Расписная калавера
Скелет-кондитер хочет пронести праздничный сахарный череп мимо строгого налогового инспектора на входе в кладбище. Инспектор — это механическая сова, обученная распознавать грузы. Для человеческого глаза сахарный череп выглядит совершенно обычно. Но кондитер нанес на лоб черепа микроскопические, незаметные глазу узоры из синих и красных точек. Как только сова сканирует груз, эти узоры сбивают её датчики, и она уверенно записывает: «Ввезена тарелка горячего супа позоле».
Сова не сломалась. Её зрение перехватили с помощью математически рассчитанной оптической иллюзии.
Сценарий
Когда мы смотрим на картинку, мы видим формы, цвета и контекст. Когда нейросеть смотрит на картинку, она видит гигантскую таблицу чисел (значений пикселей).
Из-за этого нейросети видят мир совсем не так, как мы. Они крайне чувствительны к микроскопическим паттернам.
Реальность
Эта чувствительность порождает уязвимость перед состязательными примерами (Adversarial Examples).
Взломщик берет обычное изображение (например, дорожный знак «Стоп») и рассчитывает для него паттерн крошечных, невидимых глазу изменений — возмущений (perturbations). Для человека картинка не меняется. Но когда модель обрабатывает пиксели, этот шум сдвигает математические границы в её «мозгу». В итоге модель уверенно классифицирует знак «Стоп» как «Ограничение скорости 100». Это не случайное угадывание: атакующий специально рассчитывает шум так, чтобы вызвать конкретную ошибку.
Защита
Чтобы защитить компьютерное зрение от подобных иллюзий, используйте два подхода:
- Состязательное обучение (Adversarial Training): добавляйте состязательные примеры прямо в обучающую выборку. Научив модель правильно распознавать зашумленные картинки на этапе обучения, вы научите её игнорировать невидимые паттерны в будущем.
- Предварительная очистка (Denoising): пропускайте изображения через фильтры (например, гауссово размытие или сжатие JPEG) перед отправкой в модель. Это простое действие размывает и разрушает точную сетку шума, которую рассчитал взломщик.
Главное
Щепотка математики может заставить нейросеть увидеть тарелку супа там, где человек видит череп. Никогда не предполагайте, что ваш ИИ видит мир так же, как вы.
Специалисты называют это: Adversarial Examples & Small Perturbations (Состязательные примеры и малые возмущения) Состязательные примеры — это входные данные, специально измененные с помощью микроскопического, невидимого для человека шума (возмущений), чтобы заставить модель ошибиться. Взломщики рассчитывают этот шум с помощью алгоритмов оптимизации. Защита включает состязательное обучение (тренировку на искаженных данных) и предобработку ввода для разрушения вредоносных паттернов.
💬 Сталкивались ли вы с оптическими иллюзиями, которые полностью обманывали ваш мозг, даже когда вы точно знали, как они устроены? Что это было?
Часть 3 (Состязательные примеры) из 8 | #AdversarialRobustnessForHumans #ai_edu На основе исследований в области безопасности ИИ