Языковая модель на вашем железе: запросы и документы не уходят наружу

Разворачиваем открытые модели на вашем оборудовании, подключаем к вашим документам и встраиваем туда, где сотрудники уже работают. Веса, промпты и конфигурации остаются у вас — привязки к нашему сопровождению нет.

Обследование с расчётом железа — от 200 000 ₽Пилот на ваших документах — 2–4 неделиРаботаем по NDA

На чём держится

Четыре условия, включая одно неудобное

Логотипов и «99,9% доступности» здесь не будет: доступность зависит от вашей инфраструктуры, а не от нас. Четвёртое условие — то, о чём подрядчики обычно молчат.

Проверяется отключением интернета

Самая простая проверка того, что данные не уходят: мы показываем, что система отвечает при физически отсоединённом внешнем канале. Ваша служба безопасности смотрит трафик сама.

Конфигурацию называем до закупки

Сколько видеокарт и какой памяти нужно — считается на обследовании, до того как вы что-то купите. Заранее говорим и про вариант без видеокарт.

Веса и код передаём по акту

Модель, дообученные веса, промпты, конфигурации и обучающая выборка — ваши. Никакой привязки к нашему сопровождению.

Не обещаем уровень ChatGPT

Открытая модель в контуре отвечает иначе, чем самая большая облачная. На пилоте мы это показываем на ваших вопросах, а не рассказываем словами.

Зачем это нужно

Что мешает пользоваться облачным ИИ

Внешний сервис — это передача данных

Отправить документ в чужой API значит передать его третьему лицу. Для информации ограниченного доступа этого достаточно, чтобы запретить ИИ целиком.

Готовые сервисы отвечают общо

Модель не видела ваших регламентов и договоров, поэтому отвечает правдоподобно, но не про вас.

Сотрудники всё равно пользуются

Запрет без замены не работает: рабочие документы уходят в чужие чаты с личных устройств, и это никак не отследить.

Зависимость от чужой доступности

Лимиты, изменение цен, отключение доступа. Процесс, встроенный в чужой сервис, останавливается вместе с ним.

Требования по локализации

Персональные данные и объекты категорирования накладывают ограничения, под которые облачная модель не подходит.

Руководство не доверяет чёрному ящику

Непонятно, что происходит с запросом после отправки, кто его видит и сколько он хранится.

Сравнение

Облачная модель и модель в контуре

Шесть отличий, которые видно сразу. Это не «одно лучше другого»: если у вас нет ограничений по данным, облако дешевле и быстрее стартует.

Что сравниваем
Облачная модель
Модель в контуре
Где обрабатывается запрос
ОблакоНа чужих серверах, часто за пределами страны
КонтурНа вашем оборудовании, внутри периметра
Что происходит с документом
ОблакоПередаётся третьему лицу по их правилам
КонтурНе покидает контур, это проверяется трафиком
Знание вашей специфики
ОблакоОбщие знания, ваших регламентов модель не видела
КонтурОтвечает по вашим документам со ссылкой на источник
Доступность
ОблакоЗависит от лимитов, цен и решений владельца сервиса
КонтурЗависит только от вашей инфраструктуры
Стоимость со временем
ОблакоПлатёж за каждый запрос, растёт вместе с использованием
КонтурРазовые вложения в железо плюс сопровождение
Что остаётся у вас
ОблакоНичего: ни модели, ни настроек
КонтурВеса, промпты, конфигурации и обучающая выборка
Что делаем

Восемь направлений работ

Что понадобится именно вам — становится ясно после обследования. Дообучение предлагаем только если пилот показал, что без него не обойтись.

Развёртывание открытой модели

Llama, Qwen, Mistral, GigaChat, YandexGPT в вариантах для своего железа. Подбираем размер под задачу и под то, что у вас есть.

1–3 недели

Поиск по вашим документам

Индексация регламентов, договоров и архивов. Ответ собирается из найденных фрагментов и ссылается на исходный документ.

2–5 недель

Дообучение под отрасль

Когда общей модели не хватает: адаптация под вашу терминологию, форму документов и принятые формулировки.

3–8 недель

Интеграция с системами

1С, CRM, портал, внутренний мессенджер. Модель отвечает там, где человек уже работает, а не в отдельном окне.

2–5 недель

Ассистенты для сотрудников

Вопросы по регламентам, помощь с документами, подсказки оператору. С правами доступа: кто что может спрашивать.

2–8 недель

Подбор и оптимизация железа

Квантизация, батчинг, очередь запросов. Вариант без видеокарт тоже считаем и честно говорим, где он не годится.

1–3 недели

Безопасность и журнал

Разграничение доступа, журнал запросов, защита от подмены инструкций, фильтрация того, что модель не должна отдавать.

1–3 недели

Сопровождение и обновление

Обновление моделей, дообучение на накопленном, разбор жалоб на качество ответов.

от 20 000 ₽/мес
Железо

Что обычно нужно под задачу

Ориентиры, чтобы прикинуть порядок затрат до разговора. Точную конфигурацию считаем на обследовании — до того, как вы что-то закупите.

Сценарий
Что обычно хватает
Пользователей
Что проверяем
СценарийАссистент по документамПоиск и ответ со ссылкой на источник
Что обычно хватаетМодель 7–8 млрд параметровОдна видеокарта с 24 ГБ памяти
Пользователейдо 20–30 одновременно
Что проверяемДлину документов и требуемую скорость ответа
СценарийРазбор входящих документовИзвлечение полей, классификация
Что обычно хватаетМодель 7–14 млрд параметровОдна-две видеокарты
Пользователейпоток, а не люди
Что проверяемОбъём в день и допустимую задержку
СценарийСложные ответы и рассуждениеЮридические тексты, техническая документация
Что обычно хватаетМодель 30–70 млрд параметровНесколько видеокарт или сервер целиком
Пользователейдо 10–20 одновременно
Что проверяемГотовы ли вы к такой закупке или лучше начать меньше
СценарийБез видеокартКогда закупка невозможна или не нужна
Что обычно хватаетМалая модель на процессореОбычный сервер
Пользователейединицы одновременно
Что проверяемУстроит ли скорость: ответ идёт заметно дольше

Требования определяет не «мощность ИИ», а три вещи: размер модели, число одновременных пользователей и длина документов, которые она читает. Первое мы подбираем, второе называете вы, третье выясняется на ваших материалах.

Как устроено

Что происходит с вопросом сотрудника

Четыре блока, и качество ответа определяет второй, а не третий: модель отвечает по тому, что нашёл поиск.

ВАШ КОНТУРСНАРУЖИСотрудникПортал, мессенджер илиокно системыПоиск по базеФрагменты вашихдокументов с адресомвопросМодельНа вашей видеокарте,без сети наружунайденноеЖурналКто спросил, чтонашлось, что ответилиответ и следПубличные ИИ-сервисыНе участвуют. Ни одногообращенияОбновления моделейПривозим внутрь, а не тянемнаружупроверяется отключением интернетаКачество ответа определяет второй блок, а не третий: модель отвечает по тому, что нашёл поиск.
Отсюда следует практический вывод: если ответы плохие, менять надо сначала поиск и документы, а не модель на более крупную. Замена модели дороже и почти всегда помогает меньше.
Процесс

Как идёт работа

Каждый этап закрывается актом. Остановиться можно после пилота — расчёт железа и результаты испытаний остаются у вас.

Недели 1–2 — Обследование

Смотрим задачи, документы и то, что у вас уже стоит. Подбираем размер модели и считаем конфигурацию железа. На выходе — расчёт до закупки.

Недели 2–4 — Пилот на тестовом контуре

Разворачиваем, подключаем ваши документы, показываем ответы на ваших реальных вопросах. Здесь видно, хватает ли модели.

Недели 4–8 — Настройка и дообучение

Правила поиска, границы ответов, разграничение доступа. Дообучение — только если пилот показал, что без него не обойтись.

Недели 8–10 — Интеграция

Подключаем к порталу, мессенджеру или учётной системе, чтобы модель отвечала там, где человек работает.

Приёмка

Контрольный список вопросов с ожидаемыми ответами, замер скорости на реальном числе пользователей, проверка при отключённом интернете.

Сопровождение

Обновление моделей, дообучение на накопленных исправлениях, разбор жалоб на качество.

Контроль

Что остаётся у вас и чего мы не делаем

Остаётся у вас

  • Веса модели и дообученные версии — на вашем оборудовании и в вашем хранилище.
  • Промпты, правила поиска и конфигурации — в вашем репозитории.
  • Обучающая выборка, если дообучали, и протокол испытаний.
  • Инструкция по развёртыванию: ваш администратор поднимает всё с нуля без нас.
  • Журнал запросов с разграничением: кто может смотреть, а кто нет.

Мы этого не делаем

  • Не отправляем ваши запросы во внешние сервисы. Если внешняя модель нужна для какой-то части задачи, это записано в договоре с перечнем полей.
  • Не обещаем, что открытая модель в контуре ответит как самая большая облачная. Показываем разницу на ваших вопросах на пилоте.
  • Не советуем закупать железо до обследования: конфигурация зависит от размера модели и числа пользователей.
  • Не проводим аттестацию объектов информатизации: лицензии ФСТЭК у нас нет. Мы делаем так, чтобы данные физически не покидали периметр, а закон соблюдает оператор — вы.
Разборы задач

Как это устроено внутри

Первый разбор — про изолированный контур, где наружу не уходит ни одного обращения.

Банк

Языковая модель в изолированном контуре

Облачные сервисы запрещены, а помощь сотрудникам нужна: регламенты объёмные, меняются часто.

  • Ни одного обращения наружу
  • Журнал запросов обязателен
Читать разбор →
Средний бизнес, производство

Ассистент по внутренней базе знаний

Регламенты и инструкции лежат в сетевых папках и почте, ответ ищут по двадцать минут.

  • Ответ обязан ссылаться на документ
  • Устаревшая редакция хуже отсутствия
Читать разбор →
Промышленность

Поиск по технической документации

Чертежи, паспорта и регламенты разложены по папкам и шкафам, часть — сканами разного качества.

  • Смысл в основной надписи
  • Действующая редакция неочевидна
Читать разбор →
Стек

На чём собираем

Конкретный набор зависит от задачи и от того, что уже стоит у вас. Всё перечисленное работает внутри периметра.

Модели
  • Llama
  • Qwen
  • Mistral
  • Mixtral
  • GigaChat
  • YandexGPT
  • DeepSeek
  • Phi
Запуск и ускорение
  • vLLM
  • Ollama
  • llama.cpp
  • TensorRT-LLM
  • Квантизация
  • Батчинг
  • ONNX Runtime
Поиск по документам
  • RAG
  • pgvector
  • Qdrant
  • FAISS
  • LangChain
  • LlamaIndex
  • Sentence Transformers
Контур и доступ
  • Docker
  • Kubernetes
  • NVIDIA GPU
  • Keycloak
  • SSO
  • Журнал запросов
  • Astra Linux
Кому подходит

Отрасли и типовые задачи

Госсектор и КИИ

Требования по категорированию и локализации, работа без выхода наружу, журнал обращений.

Финансы и страхование

Персональные данные и банковская тайна, помощь оператору по регламенту, разбор документов.

Медицина и лаборатории

Врачебная тайна, поиск по протоколам и инструкциям, подсказки по нормативам.

Промышленность

Техническая документация, регламенты, инструкции по оборудованию, помощь дежурной смене.

Любая компания с запретом на облако

Если ИИ запрещён политикой безопасности — это не отказ от ИИ, а требование к тому, где он живёт.

Заявка

Развернём модель в вашем контуре

Сорок минут созвона: какие задачи, какие документы, что уже есть из железа и что запрещает служба безопасности. По итогам назовём размер модели, конфигурацию и порядок затрат.

Спасибо, заявка отправлена. Ответим в течение рабочего дня.

Не удалось отправить. Напишите в телеграм или позвоните.

Вопросы

Частые вопросы

Какое железо нужно?

Зависит от размера модели, числа одновременных пользователей и длины документов. Для ассистента по документам обычно хватает одной видеокарты с 24 ГБ памяти. Точную конфигурацию считаем на обследовании — до того, как вы что-то закупите.

Можно ли обойтись без видеокарт?

Можно, на малой модели и процессоре. Ответ идёт заметно медленнее, и для десятков одновременных пользователей это не подойдёт. Мы честно говорим, где такой вариант годится, а где нет.

Насколько ответы хуже, чем у ChatGPT?

На общих вопросах открытая модель в контуре обычно слабее самой большой облачной. На ваших документах разрыв меньше: там решает не размер модели, а качество поиска по вашей базе. Разницу показываем на пилоте, на ваших реальных вопросах.

Сколько занимает развёртывание?

Пилот на тестовом контуре — две-четыре недели с момента, когда есть железо и документы. Полная настройка с интеграцией и разграничением доступа — два-три месяца.

Что если у нас мало данных для дообучения?

Для поиска по документам дообучение вообще не нужно — достаточно самих документов. Дообучение имеет смысл, когда у вас своя терминология и формы, и мы предлагаем его только если пилот показал, что без него не обойтись.

Кому принадлежит модель и код?

Вам. Веса, дообученные версии, промпты и конфигурации передаются по акту. Привязки к нашему сопровождению нет: развернуть и обновлять сможет ваш администратор или другой подрядчик.

Сколько это стоит?

Обследование с расчётом железа — от 200 000 ₽. Пилот — от 400 000 ₽. Проект целиком, с интеграциями и разграничением доступа, — от 3 000 000 ₽. Стоимость оборудования считается отдельно и остаётся у вас как актив.