Классическая ИБ защищает серверы и сети. AI-системы добавляют новый пласт рисков, которые не закрываются привычными средствами. Вот главные из них.
1. Prompt injection
Злоумышленник встраивает вредоносные инструкции во входные данные (сообщение, документ, веб-страницу), заставляя модель игнорировать исходные правила. Итог - обход ограничений или выдача того, что должно быть скрыто.
Защита: разделение системных и пользовательских инструкций, фильтрация ввода, ограничение прав агента, проверка вывода перед выполнением действий.
2. Утечка конфиденциальных данных
Модель может «проговорить» данные, к которым имеет доступ, или воспроизвести фрагменты обучающей выборки.
Защита: минимизация доступа к данным, DLP-фильтры на выходе, развёртывание в закрытом контуре (on-premise), маскирование чувствительной информации.
3. Отравление обучающих данных
Если данные для обучения можно подменить, атакующий закладывает в модель скрытое нежелательное поведение.
Защита: контроль происхождения данных, валидация выборки, версионирование датасетов и мониторинг качества модели.
4. Кража и копирование модели
Через массовые запросы можно «выкачать» поведение модели и воссоздать её аналог.
Защита: лимиты запросов, мониторинг аномалий, водяные знаки и контроль доступа к API.
5. Adversarial-атаки
Специально искажённые данные (например, изображение) заставляют модель ошибаться там, где человек не видит проблемы - критично для компьютерного зрения.
Защита: состязательное дообучение, ансамбли моделей и проверки на устойчивость.
Безопасность ИИ - это не разовое действие, а процесс: угрозы эволюционируют быстрее, чем выходят стандарты. Ориентир для команд - OWASP Top 10 для LLM.
Что делать на практике
- Проведите аудит защищённости модели до вывода в прод.
- Организуйте red team-тестирование: атакуйте свою модель раньше, чем это сделают другие.
- Настройте guardrails, логирование и мониторинг поведения ИИ.
- Для критичных систем используйте закрытый контур и требования КИИ.
Безопасность, заложенная с самого начала (Secure-by-Design), обходится в разы дешевле, чем устранение последствий инцидента.