Обратная разработка: Раскопка предков
Скелет-могильщик хочет украсть секретный рецепт легендарного ацтекского шоколада. Рецепт был похоронен вместе с давно почившим шеф-поваром. Вместо того чтобы раскапывать могилу, вор находит говорящий череп-ассистент, которого обучали описывать кухонные ароматы. Вор задает черепу миллионы мелких, слегка отличающихся вопросов о специях. Анализируя реакцию ассистента, вор восстанавливает рецепт слово за словом.
Череп думал, что просто рассуждает о запахах. Но его воспоминания оказались слишком точными.
Сценарий
Когда вы обучаете модель, она учится на ваших личных данных: медицинских картах, переписках клиентов или финансовых логах. Вам кажется, что эти данные в безопасности, ведь вы публикуете только готовую модель, а не сам обучающий набор.
Но у моделей есть привычка запоминать ввод слишком хорошо.
Реальность
Это открывает путь для атак извлечения данных и инверсии модели (Model Inversion).
Атакующий отправляет модели миллионы запросов. Анализируя вероятность ответов или генерируемый текст, он может воссоздать исходные данные. Если модель обучалась на личных письмах, взломщик может заставить её выдать номера карт или адреса, которые были в обучающей выборке. Также они могут использовать проверку на членство (Membership Inference), чтобы узнать, были ли данные конкретного человека в обучении — для этого проверяют, насколько неестественно уверена модель в ответах на запросы об этом человеке.
Защита
Чтобы никто не смог раскопать ваши приватные данные, внедрите следующие меры:
- Дифференциальная приватность: обучайте модель по методу DP-SGD. Эта математическая техника добавляет контролируемый шум при обучении, благодаря чему модель усваивает общие правила, но физически теряет способность запоминать конкретные примеры.
- Ограничение точности API: округляйте оценки уверенности на выходе. Вместо возврата «совпадение 99,843%» отдавайте просто «99%». Это лишит взломщика точных цифр, необходимых для воссоздания исходных данных.
Главное
Модель — это не сейф, а губка. Если вы обучили её на секретах, будьте готовы к тому, что эти секреты из неё выжмут.
Специалисты называют это: Model Inversion & Data Extraction (Инверсия модели и извлечение данных) Атаки инверсии модели и извлечения данных позволяют воссоздать приватные обучающие данные путем анализа ответов и выходных распределений модели. Атаки на проверку членства определяют, использовались ли конкретные данные при обучении. Защита включает обучение с дифференциальной приватностью (DP) и снижение точности ответов API.
💬 Бывало ли у вас такое, что вы запоминали какую-то ненужную мелочь настолько намертво, что её никак не получалось забыть? Что это было?
Часть 2 (Обратная разработка) из 8 | #AdversarialRobustnessForHumans #ai_edu На основе лекций по безопасности ИИ