Проверяем, что ваш ИИ не выполняет чужие инструкции и не отдаёт лишнего

Пробуем обойти ограничения, вытащить то, к чему у роли нет доступа, и заставить агента сделать больше положенного. Что нашли — воспроизводим, оцениваем и помогаем закрыть. Всё на вашем стенде.

Проверка системы — от 350 000 ₽Отчёт с воспроизведением находокРаботаем по NDA

Граница услуги

Что это за работа и чем она не является

Первое условие читайте внимательно: оно определяет, за чем к нам стоит приходить, а за чем — нет.

Это инженерная проверка, а не лицензируемая работа

Мы проверяем, как ведёт себя ваша модель, и настраиваем ограничения. Лицензии ФСТЭК у нас нет: аттестацию объектов, оценку соответствия и работы по защите гостайны выполняет лицензиат.

Проверяем на вашем стенде

Копию вашей базы и записи разговоров с моделью наружу не выносим. Тесты гоняются в вашем контуре, отчёт остаётся у вас.

Критерий «пройдено» пишем заранее

До начала договариваемся, что считается провалом по каждому классу проверок. Иначе отчёт превращается в список впечатлений.

Не используем ваши данные для обучения

Ни ваши документы, ни ваши запросы к модели не попадают ни в какие наши выборки. Это отдельный пункт договора.

Зачем это нужно

Что случается с ИИ, который никто не проверял

Модель выполняет чужую инструкцию

В присланном документе написано «игнорируй прежние указания» — и она игнорирует. Классическая подмена инструкций, и она работает чаще, чем кажется.

Отдаёт то, что видеть не должны

Ассистент находит документ, к которому у спрашивающего нет доступа, и пересказывает его содержание.

Агент делает лишнее

Право менять данные выдали сразу и целиком. Одна ошибка разбора — и в учёте появляются записи, которых там быть не должно.

Отвечает уверенно и неверно

Порога, ниже которого система обязана промолчать и позвать человека, не существует. Ошибка выглядит так же убедительно, как правильный ответ.

Качество падает молча

Реальность изменилась, метрику никто не смотрит. Замечают через полгода по жалобам, а не по сигналу.

Нет журнала

Спорный случай разобрать нельзя: непонятно, что спросили, что нашлось и на каком основании система ответила.

Проверки

Что именно проверяем

Третья колонка — самая важная. Мы договариваемся о ней до начала работ, иначе отчёт превращается в список впечатлений, с которым нечего делать.

Что проверяем
Как выглядит провал
Что считается пройденным
Срок
Что проверяемПодмена инструкцийPrompt injection в запросе и в документе
Как выглядит провалМодель выполняет команду, пришедшую с данными, а не от вас
Что считается пройденнымИнструкции из содержимого документов не исполняются, попытка попадает в журнал
Срок3–5 дней
Что проверяемОбход ограниченийОбёртки, ролевые игры, перевод, кодирование
Как выглядит провалЗапрет снимается переформулировкой запроса
Что считается пройденнымОграничение держится на согласованном наборе сценариев, отказ мотивирован
Срок3–5 дней
Что проверяемВыдача лишнегоДанные вне прав спрашивающего
Как выглядит провалОтвет собирается из документов, к которым у пользователя нет доступа
Что считается пройденнымПоиск ограничен правами, в ответ не попадает то, чего нельзя видеть
Срок3–7 дней
Что проверяемДействия агентаГраницы автономности и права
Как выглядит провалАгент выполняет операцию, которую должен был отдать человеку
Что считается пройденнымОперации вне списка требуют подтверждения, каждая записана в журнал
Срок3–7 дней
Что проверяемУверенность и молчаниеПорог, ниже которого система не отвечает
Как выглядит провалНа вопрос без ответа в базе выдаётся правдоподобная выдумка
Что считается пройденнымНиже порога — отказ со ссылкой на то, что данных нет, и передача человеку
Срок2–4 дня
Что проверяемСтабильность качестваЗамер на контрольном наборе
Как выглядит провалСравнить не с чем: постоянного набора задач нет
Что считается пройденнымЕсть неизменяемая выборка и регулярный замер с сигналом при просадке
Срок3–5 дней
Как устроено

Пять рубежей, а не один

Ограничения ставятся в пяти местах. Проверять и настраивать нужно все — по отдельности каждое закрывает только свой класс проблем.

ГДЕ СТАВЯТСЯ ОГРАНИЧЕНИЯЗапросПроверка входа: инструкциииз данных не исполняютсяПоискОграничен правами того,кто спросилМодельПорог уверенности: ниже —отказ и человекОтветПроверка перед выдачей:маскирование, темыЖурналКто, что, на какомоснованииОдного рубежа не хватает: проверка входа не спасёт от выдачи лишнего, а порог уверенности — от подмены инструкций.Поэтому проверяем и настраиваем все пять, а не тот, о котором вспомнили первым.Абсолютной защиты не бывает. Цель — сделать попытки дорогими, а сами попытки — видимыми в журнале.
Самый пропускаемый рубеж — второй: поиск, ограниченный правами того, кто спросил. Без него ассистент честно находит документ, к которому у человека нет доступа, и добросовестно его пересказывает.
Что делаем

Восемь направлений работ

Проверка и устранение — разные этапы с разной ценой. Мы намеренно их разделяем.

Проверка модели на обход

Подмена инструкций, обёртки, ролевые сценарии, кодирование и перевод. Ручные попытки плюс автоматический перебор.

1–2 недели

Проверка на выдачу лишнего

Пробуем получить то, к чему у роли нет доступа: чужие документы, системные инструкции, фрагменты обучающих данных.

1–2 недели

Разбор границ агента

Что он делает сам, что подтверждает человек, что запрещено полностью. Проверяем, держатся ли границы под нагрузкой и при странных входных данных.

1–2 недели

Пороги и отказы

Настраиваем уровень уверенности, при котором система обязана промолчать, и формулировку отказа, понятную пользователю.

3–7 дней

Фильтры входа и выхода

Маскирование персональных данных, ограничение тем, проверка ответа до того, как он ушёл человеку.

1–2 недели

Журнал и разграничение прав

Кто спросил, что нашлось, что ответили, кто может смотреть эти записи. Без журнала спорный случай разобрать нельзя.

1–2 недели

Мониторинг качества

Контрольная выборка, регулярный замер, отслеживание распределения входных данных, сигнал при просадке.

1–2 недели

Регламент и обучение

Что делать при подозрительной активности, кто отвечает, как пользоваться системой безопасно. Инструкции по ролям.

3–7 дней
Процесс

Как идёт работа

Последний шаг обязателен: без повторной проверки отчёт остаётся списком намерений.

Дни 1–3 — Доступы и контекст

Понимаем, что за система, кто ей пользуется, какие данные она видит и что считается недопустимым. NDA подписываем до получения доступов.

Дни 3–7 — Разбор архитектуры

Смотрим, как устроены поиск, права, промпты и интеграции. Половина слабых мест видна здесь, до всяких атак.

Недели 2–3 — Проверки

Ручные попытки и автоматический перебор по согласованному списку классов. Каждая находка воспроизводится и записывается.

Дни 3–5 — Отчёт

Находки с оценкой критичности, воспроизведением и предложением, что делать. Отдельно — что мы не проверяли и почему.

Недели 3–6 — Устранение

Вместе с вашей командой закрываем найденное: пороги, фильтры, права, журнал. Или передаём отчёт, если делать будете сами.

Повторная проверка

Прогоняем те же сценарии заново и показываем разницу. Без этого шага отчёт остаётся списком намерений.

Контроль

Что остаётся у вас и чего мы не делаем

Остаётся у вас

  • Отчёт с воспроизведением каждой находки — им можно пользоваться без нас.
  • Список того, что мы не проверяли, и почему: границы работы честнее её результатов.
  • Конфигурации фильтров, порогов и правил — в вашем репозитории.
  • Набор сценариев для повторной проверки: прогонять его можно самостоятельно после каждого обновления.
  • Регламент: кто получает сигнал о подозрительной активности и что делает дальше.

Мы этого не делаем

  • Не проводим аттестацию объектов информатизации и оценку соответствия: это лицензируемая деятельность, лицензии ФСТЭК у нас нет.
  • Не выполняем работы, связанные с государственной тайной.
  • Не выдаём заключений о соответствии требованиям регуляторов. Мы готовим систему и материалы, а соответствие подтверждает организация с лицензией.
  • Не обещаем «утечки исключены». Проверка снижает вероятность и делает попытки видимыми, но абсолютной защиты не бывает — кто обещает обратное, продаёт спокойствие, а не безопасность.
Разборы задач

Как это устроено внутри

Первый разбор — про контур, где журнал запросов обязателен, а права важнее полноты ответа.

Банк

Языковая модель в изолированном контуре

Ни одного обращения наружу, журнал запросов обязателен, а ответ не должен выходить за права спрашивающего.

  • Журнал запросов обязателен
  • Права важнее полноты ответа
Читать разбор →
Средний бизнес

ИИ-пилот, который не выходит из демонстрации

Одна из частых причин остановки — служба безопасности не согласовала архитектуру и доступы.

  • Нет письменного критерия
  • Права и журнал не описаны
Читать разбор →
Средний бизнес, производство

Ассистент по внутренней базе знаний

Ответ обязан ссылаться на документ, а устаревшая редакция хуже отсутствия ответа.

  • Ответ со ссылкой на источник
  • Порог уверенности до запуска
Читать разбор →
Методы

Чем и по чему проверяем

Автоматический перебор находит типовое, руками находится специфичное для вашей системы. Нужно и то, и другое.

Методики
  • OWASP Top 10 для LLM
  • Ручной перебор сценариев
  • Фаззинг промптов
  • Проверка по ролям
  • Регрессия на контрольном наборе
Инструменты
  • Garak
  • Adversarial Robustness Toolbox
  • Свои наборы сценариев
  • NeMo Guardrails
  • Presidio для маскирования
Наблюдение
  • Журнал запросов
  • Prometheus
  • Grafana
  • Отправка событий в SIEM
  • Пороговые оповещения
Контур
  • Keycloak
  • SSO и роли
  • Docker с ограничениями
  • Сетевые политики
  • Шифрование хранилища
Кому подходит

Кто обычно приходит

Уже внедрили ассистента или агента

Система работает, но никто не проверял, что она отдаёт и кому. Обычно это выясняется в первый же день проверки.

Финансы, медицина, госсектор

Там, где утечка стоит дороже пользы, а служба безопасности требует показать, что риски разобраны.

Разработчики ИИ-продуктов

Нужен взгляд со стороны до выхода на рынок: своя команда не видит того, к чему привыкла.

Готовитесь к проверке

Мы приводим систему и документы в порядок, а заключение выдаёт организация с лицензией — это разные работы.

Заявка

Проверим вашу систему

Сорок минут созвона: что за система, кто ей пользуется, какие данные она видит и что считается недопустимым. По итогам назовём набор проверок, цену и срок.

Спасибо, заявка отправлена. Ответим в течение рабочего дня.

Не удалось отправить. Напишите в телеграм или позвоните.

Вопросы

Частые вопросы

У нас нет своей команды ИБ. Это проблема?

Нет. Отчёт написан так, чтобы его понял технический руководитель, а не только специалист по безопасности. Устранить находки можем мы, ваша команда разработки или любой другой подрядчик.

Сколько времени занимает проверка?

Разбор архитектуры — неделя, активные проверки — одна-две, отчёт — несколько дней. Устранение найденного считается отдельно и зависит от того, что нашлось.

Что мы получим на выходе?

Отчёт с воспроизведением каждой находки, оценкой критичности и предложением, что делать. Отдельный раздел — что мы не проверяли и почему. Плюс набор сценариев, чтобы вы могли прогонять проверку сами после обновлений.

Работаете ли вы с системами внутри контура?

Только так и работаем. Тесты гоняются на вашем стенде, записи разговоров с моделью и копии базы наружу не выносим.

Что такое порог допуска и зачем он нужен?

Уровень уверенности, ниже которого система обязана не отвечать, а сказать «не знаю» и позвать человека. Без него модель выдаёт правдоподобную выдумку с той же интонацией, что и правильный ответ.

Поможете устранить найденное?

Да, если нужно. Но это отдельный этап с отдельной ценой: смешивать проверку и продажу доработок — плохая практика, потому что тогда находить уязвимости становится выгодно.

Сколько это стоит?

Проверка одной системы — от 350 000 ₽ в зависимости от числа сценариев и ролей. Устранение найденного считается после отчёта, по конкретному списку.