Услуга

ИИ-агенты на локальной модели: данные остаются у вас

Михаил Мозг3 минуты чтения

Мы собираем ИИ-агентов на локальной модели: открытая модель работает внутри вашего периметра, на компьютере в кабинете, на сервере в вашем дата-центре или на арендованных GPU российского провайдера. Агенты те же, что и на облачных моделях: продажи, поддержка, разбор документов, запись клиентов, панель руководителя. Меняется только то, где живет модель и данные.

Что делаем

Подбираем открытую модель по вашим 50 запросам: 8–9 млрд, 30 млрд или 70 млрд параметров, русскоязычную или мировую. Считаем железо по калькуляторам и даем спецификацию для покупки или аренды. Ставим движок под нагрузку: для одного пользователя или для параллельной работы отдела. Собираем агентов через единый интерфейс модели, чтобы облако и локальная модель менялись настройкой. Настраиваем маршрутизацию для гибридной схемы и обезличивание перед отправкой в облако. Ставим мониторинг и передаем вашему инженеру с инструкцией.

Пилот: 14 дней, от 150 000 ₽

Один агент на одном процессе на вашем или арендованном железе. Метрика в договоре: доля обращений без оператора, минуты на документ, время ответа. Экзамен на 50 запросах до и после. Результат: работающий агент, отчет с цифрами и расчет железа для масштабирования. Если локальная модель задачу не тянет, говорим об этом в отчете и показываем, где ее тянет облако.

ИИ-отдел: 4–6 недель, от 450 000 ₽

3–5 агентов на одной локальной модели с общей базой знаний и очередью задач: например, разбор входящих обращений, ответы по документам, подготовка черновиков и панель руководителя. Сервер или рабочая станция по нашей спецификации, движок для параллельной работы, маршрутизация в облако для задач на обезличенных данных. Для крупных компаний: от 1 500 000 ₽ за 2–3 месяца с несколькими отделами и интеграциями.

Поддержка: от 40 000 ₽ в месяц

Обновления модели и движка с повторным экзаменом, мониторинг, разбор инцидентов, план на отказ карты. ИИ-директор от 100 000 ₽ в месяц: человек, который ведет ваши агенты и локальную инфраструктуру как продукт, с отчетом руководителю.

Чего не делаем

Не продаем железо и не берем комиссию с продавцов: спецификацию вы покупаете где хотите. Не обещаем, что локальная модель решит задачу флагмана: это проверяется пилотом. Не обучаем модели с нуля; дообучение на ваших данных возможно как отдельный проект. Не даем юридических заключений по 152-ФЗ и 243-ФЗ: описываем архитектуру, заключение дает ваш юрист.

Почему мы считаем обе стороны

Мы собираем агентов и на облачных, и на локальных моделях, поэтому нам не нужно продать вам сервер. Калькуляторы в этом разделе показывают, когда облако дешевле, и мы говорим это в пилоте. Основатель Михаил Мозг ведет медиа-канал и разбирает кейсы публично; цифры на этой странице те же, что в договоре.

Вопросы и ответы

На каком железе делаете пилот, если у нас его нет?

На арендованной карте в российском облаке: RTX 4090 от 43 ₽ в час, H100 от 242 ₽ в час, аренда входит в смету пилота. Данные остаются в России по договору с провайдером.

Можно ли потом перевести агентов на облачную модель?

Да, настройкой: агенты подключены через единый интерфейс модели. Так же переезжают с облака на локальную модель.

Что с персональными данными в пилоте?

Пилот идет на обезличенных или тестовых данных, пока не подписаны документы по 152-ФЗ. На локальной модели данные не покидают ваш периметр или российское облако с договором поручения.

Источники и даты

  1. Tproger, облачные GPU для ML в 2026 году, 21.05.2026tproger.ru
  2. Intelion Cloud, аренда H100/H200 (проверено 29.09.2026)intelion.cloud
  3. Anti-Malware, 152-ФЗ и нейросети, 17.06.2026anti-malware.ru
  4. GPU Индекс, аренда RTX 4090 в России: 173 предложения, от 31,75 ₽ в час (проверено 30.09.2026)gpuindex.ru
  5. GPU Индекс, аренда H100 в России: 41 предложение, от 242 ₽ в час (проверено 30.09.2026)gpuindex.ru
  6. Цифровые платформы, кейс №2447, октябрь 2025: Т-Банкplatforms.su
  7. Цифровые платформы, кейс №3855, 2 сентября 2026: Т-Технологииplatforms.su
  8. Цифровые платформы, кейс №4067, 2 сентября 2026: Альфа-Банк, ИТ-руководительplatforms.su
  9. Цифровые платформы, кейс №2929, 2025: ИТ-холдинг Т1platforms.su
  10. Цифровые платформы, кейс №3475, 2 сентября 2026: НСИС, оператор АИС страхованияplatforms.su
  11. Цифровые платформы, кейс №3661, 2 сентября 2026: Digital Sector и заказчик из ИТ-инфраструктурыplatforms.su
  12. Цифровые платформы, кейс №4084, 2 сентября 2026: VK Techplatforms.su
  13. Цифровые платформы, кейс №2874, 2025: ЛАНИТplatforms.su
  14. Цифровые платформы, кейс №3570, 2 сентября 2026: Минюст Россииplatforms.su
  15. Цифровые платформы, кейс №3509, 2 сентября 2026: Департамент здравоохранения Москвыplatforms.su
  16. Цифровые платформы, кейс №3502, 2 сентября 2026: Аэропорт Пулковоplatforms.su
Михаил Мозг

Михаил Мозг

Основатель MMOOZZGG, ИИ-директор

Подробнее о Михаиле@mmoozzggru

Кейсы по теме: 16

  • Кейс рынка · Россия

    Т-Банк собственные LLM решают 45% обращений, по оценке затраты на поддержку ниже минимум на 25% в год

    Банк встроил в чат-бот собственные языковые модели семейства Gen-T: около 45% обращений клиентов решаются без оператора. В октябре 2025 года запущены ИИ-копайлоты для операторов первой линии, ими ежедневно пользуются более 90% сотрудников поддержки. Модели развернуты в периметре банка, данные вовне не передаются.

    Банки и финансы

    источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Т-Технологии ИИ-ассистент для задач с деньгами на собственных моделях Gen-T, бета с 20 июля 2026

    Группа разработала ИИ-ассистента для задач, связанных с деньгами и покупками, на собственных больших языковых моделях семейства Gen-T. Чтобы избежать выдумок, система опирается на верифицированные источники данных, а не только на знания модели. Бета представлена 20 июля 2026 года, полноценный запуск запланирован на осень.

    Банки и финансы

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Альфа-Банк, ИТ-руководитель локальный агент на модели Qwen 3.6-35B-A3B: около 70 токенов в секунду на Mac

    Автономный рабочий агент работает на локально развернутой модели с 35 млрд параметров и примерно 3 млрд активных на токен через LM Studio, скорость около 70 токенов в секунду на Mac. Сначала агент запускался в Docker на Mac, затем переехал на виртуальную машину, что стало переломным моментом по удобству.

    Банки и финансы

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    ИТ-холдинг Т1 согласование договоров за 3 дня вместо двух недель, затраты на сравнение документов ниже на 40%

    Юридический департамент холдинга, более 70 юристов, больше года обучал собственную языковую модель на юридических данных компании. Согласование договоров сократилось с двух недель до трех дней, сравнение двух версий документа выполняется в пять раз быстрее, чем вручную.

    ИТ-компании

    источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    НСИС, оператор АИС страхования обработка обращений в 20 раз быстрее на локальной LLM, рост обращений в 1,5 раза без найма

    Оператор национальной страховой информационной системы развернул большую языковую модель локально и построил на ней три контура: автоматическую обработку обращений с множественными полями, RAG-сервис технической поддержки на документах компании и ИИ-агентов в процессе разработки, включая автоматический код-ревью.

    ИТ-компании

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Digital Sector и заказчик из ИТ-инфраструктуры ИИ-агент анализа договоров в закрытом контуре заказчика; во внутреннем тестировании интегратора агенты высвободили 20% времени команды

    Интегратор реализовал ИИ-агента для первичного анализа договоров в закрытом контуре заказчика, который проектирует и поставляет ИТ-инфраструктуру: агент извлекает и сопоставляет данные, выявляет расхождения и готовит результат для специалиста. Агентов интегратор внедрил и в собственные процессы тестирования: высвобождено 20% рабочего времени команды за спринт.

    ИТ-компании

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    VK Tech две модели уместились в 22,4 ГБ из 24 ГБ видеопамяти при контексте 65 536 токенов

    Команда собрала локального ИИ-агента в закрытом контуре на связке Ollama и агентной обвязки на арендованном GPU-сервере с картой NVIDIA A30 на 24 ГБ. Модели: gpt-oss 20b (13 ГБ) для текста и инструментов и qwen3-vl 8b (6,1 ГБ) для изображений; вместе с KV-кэшем на контекст 65 536 токенов занято 22,4 ГБ.

    ИТ-компании

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    ЛАНИТ сбор требований в 4 раза быстрее, время поиска документов на 66% меньше на платформе локальных LLM

    Группа разработала платформу для локального развертывания больших языковых моделей на инфраструктуре заказчика: чат и сложные конвейеры обработки документов, аудио и изображений. Дочерняя компания создала собственную модель, дообученную на русскоязычных данных, и пилотирует ее в CRM-, SRM- и HRM-проектах и корпоративных чат-ботах.

    ИТ-компании

    источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Минюст России аватар-юрист с базой федеральных законов, для него обучают локальную языковую модель

    Первый отечественный аватар-юрист распознает разговорную речь и консультирует по правовым вопросам; в базе знаний федеральные законы, нормативные акты и информация с сайта министерства. По состоянию на июль 2026 года специалисты обучают локальную языковую модель, чтобы ускорить работу и улучшить ответы.

    Госсектор

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Департамент здравоохранения Москвы ИИ-помощник для аналитики стационаров на локальной языковой модели: данные не покидают периметр

    В витрины данных единой медицинской системы города встроен ИИ-помощник на локально развернутой большой языковой модели. Локальное развертывание выбрано для работы с чувствительными медицинскими данными без их передачи вовне.

    Госсектор

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Аэропорт Пулково ИИ-плагин безопасной разработки в закрытом контуре: точность более 90% на проверке находок и до 85% на исправлении

    Служба информационной безопасности аэропорта встроила анализ кода в среду разработки, а разбор уязвимостей и исправление кода передала обученному ИИ-плагину, который работает в закрытом контуре без выхода данных наружу. Точность модели более 90% на верификации находок и до 85% на исправлении уязвимостей.

    Промышленность и инфраструктура

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Агрохолдинг «Степь» собственная ИИ-экосистема на локальных нейросетях, чтобы не передавать данные в публичные сервисы

    Холдинг строит ИИ-экосистему на локальных нейросетях, агентах и чат-ботах, чтобы конфиденциальные данные не уходили в публичные сервисы. Реализована синхронизация данных управления стадом с государственной системой, развернут мониторинг правовой информации для бэк-офиса, запущено несколько аналитических проектов.

    Промышленность и инфраструктура

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Девелопер MR ИИ-контролер проектного финансирования в изолированном контуре: время на анализ кредитной документации меньше на 80%

    Девелопер вместе с банком внедрил ИИ-контролера на российской языковой модели для автоматической проверки условий проектного финансирования и мониторинга кредитных обязательств. По данным компании, время на анализ кредитной документации сократилось на 80%. Каждый крупный проект сопровождают сотни страниц кредитной документации и десятки дополнительных соглашений; система собирает мастер-версию каждого договора и ведет единый календарь обязательств.

    Промышленность и инфраструктура

    15 сентября 2026 · источник: comnews.ru

    Читать кейс
  • Кейс рынка · Россия

    Фаберлик нейросетевой поиск по каталогу на локальной модели Qwen и арендованных GPU

    Производитель косметики заменил классический поиск по каталогу нейросетевым: локальная языковая модель Qwen и векторный семантический поиск развернуты на GPU-инфраструктуре российского облака. Модель работает внутри контролируемой инфраструктуры, данные не передаются во внешние сервисы, затраты на обработку запросов под контролем.

    Ритейл и производство

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Петрович-Тех локальная модель на 9 млрд параметров сравнялась с облачными на задачах из 2–3 шагов: 27 прогонов

    ИТ-подразделение сети строительных магазинов сравнило три модели в единой агентной обвязке с 13 виджетами аналитической панели и около 30 инструментами: облачную западную модель, облачную открытую модель на 235 млрд параметров и локальную модель на 9 млрд параметров в 4-битной квантизации на одной видеокарте. Схема: 3 сценария, 3 модели, 3 прогона, 27 запусков.

    Ритейл и производство

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Т2 (Tele2) тендер на ИИ-ассистента разработчика в закрытом ЦОД: 15 разработчиков, отклик не более 400 мс

    В феврале 2026 года оператор разместил тендер на автономного ИИ-ассистента для разработчиков, который разворачивается в закрытом дата-центре компании в Ростове-на-Дону, чтобы исходный код не покидал инфраструктуру. Требования: 15 пользователей, автодополнение с откликом не более 400 мс, шесть языков программирования.

    Связь

    2026 · источник: platforms.su

    Читать кейс
Все кейсы: 18

Цены и замеры в разделе проверены 29.09.2026 по источникам внизу страниц. Мы собираем ИИ-агентов на облачных и локальных моделях и не продаем железо. Расчеты оценочные, юридические выводы по 152-ФЗ и 243-ФЗ дает ваш юрист.

Контакты

Разберем, где вашей компании нужен локальный ИИ, а где хватит облака

Посчитаем железо, токены и людей на ваших цифрах и скажем честно, что дешевле. Бесплатно, 30 минут.

Telegram

@mmoozzggru

Ответим в течение рабочего дня. Все контакты

Написать в Telegram