Классическая ИБ защищает серверы и сети. AI-системы добавляют новый пласт рисков, которые не закрываются привычными средствами. Вот главные из них.

1. Prompt injection

Злоумышленник встраивает вредоносные инструкции во входные данные (сообщение, документ, веб-страницу), заставляя модель игнорировать исходные правила. Итог - обход ограничений или выдача того, что должно быть скрыто.

Защита: разделение системных и пользовательских инструкций, фильтрация ввода, ограничение прав агента, проверка вывода перед выполнением действий.

2. Утечка конфиденциальных данных

Модель может «проговорить» данные, к которым имеет доступ, или воспроизвести фрагменты обучающей выборки.

Защита: минимизация доступа к данным, DLP-фильтры на выходе, развёртывание в закрытом контуре (on-premise), маскирование чувствительной информации.

3. Отравление обучающих данных

Если данные для обучения можно подменить, атакующий закладывает в модель скрытое нежелательное поведение.

Защита: контроль происхождения данных, валидация выборки, версионирование датасетов и мониторинг качества модели.

4. Кража и копирование модели

Через массовые запросы можно «выкачать» поведение модели и воссоздать её аналог.

Защита: лимиты запросов, мониторинг аномалий, водяные знаки и контроль доступа к API.

5. Adversarial-атаки

Специально искажённые данные (например, изображение) заставляют модель ошибаться там, где человек не видит проблемы - критично для компьютерного зрения.

Защита: состязательное дообучение, ансамбли моделей и проверки на устойчивость.

Безопасность ИИ - это не разовое действие, а процесс: угрозы эволюционируют быстрее, чем выходят стандарты. Ориентир для команд - OWASP Top 10 для LLM.

Что делать на практике

  • Проведите аудит защищённости модели до вывода в прод.
  • Организуйте red team-тестирование: атакуйте свою модель раньше, чем это сделают другие.
  • Настройте guardrails, логирование и мониторинг поведения ИИ.
  • Для критичных систем используйте закрытый контур и требования КИИ.

Безопасность, заложенная с самого начала (Secure-by-Design), обходится в разы дешевле, чем устранение последствий инцидента.