Практика

Как внедрить локальный ИИ: восемь шагов с цифрами

Михаил Мозг3 минуты чтения

Внедрить локальный ИИ в компании надежнее в таком порядке: сначала правила про данные, потом одна задача, потом железо. Ниже восемь шагов с тем, что сделать, сколько это стоит и как понять, что шаг пройден.

Шаг 1. Политика данных

Разделите данные на три класса: можно наружу, только в российское облако, только внутри периметра. Агрохолдинг из кейсов раздела проводит вебинары для сотрудников и до конца 2026 года утверждает внутреннюю политику по ИИ. Результат шага: одна страница правил, подписанная руководителем.

Шаг 2. Одна задача с измеримым результатом

Возьмите задачу с потоком: разбор обращений, проверка договоров, ответы по базе знаний, черновики документов. Запишите метрику до старта: минуты на документ, доля обращений без оператора, число ошибок. Оператор связи вписал в тендер отклик до 400 мс и точность рефакторинга не ниже 85%: так выглядит измеримая задача.

Шаг 3. 50 тестовых запросов

Соберите 50 реальных запросов с ожидаемыми ответами. Это ваш экзамен для любой модели, облачной или локальной, и он важнее любого рейтинга. Сеть магазинов прогнала 3 сценария на 3 моделях по 3 раза и получила ответ за 27 запусков.

Шаг 4. Проба на арендованной карте

Арендуйте RTX 4090 от 43 ₽ в час или H100 от 242 ₽ в час в российском облаке с почасовой оплатой, поставьте Ollama или vLLM, прогоните 50 запросов на двух-трех открытых моделях: 8–9 млрд, 30 млрд, 70 млрд. Считайте качество и скорость. Неделя проб стоит 7 200–40 700 ₽ и заменяет покупку вслепую на миллион.

Шаг 5. Модель и движок

Выберите наименьшую модель, которая прошла экзамен: она дешевле по памяти и быстрее. Движок по числу пользователей: LM Studio или Ollama для одного, vLLM для отдела. Зафиксируйте версии модели и движка: обновление это отдельное событие с повторным экзаменом.

Шаг 6. Железо по калькулятору

Введите модель, контекст и число пользователей в калькулятор памяти, получите список подходящего железа. Затем калькулятор стоимости в месяц и точка окупаемости против облака. Ориентиры на 29.09.2026 по нашему расчету: Mac Studio со 128 ГБ 886 757 ₽ для 1–3 пользователей, рабочая станция с RTX 5090 около 1,1 млн ₽, сервер с двумя картами по 96 ГБ около 2,5 млн ₽ для отдела. Если окупаемости нет, а данные могут выходить наружу, остановитесь на облаке или аренде.

Шаг 7. Агенты через единый интерфейс

Агенты подключаются к модели через единый интерфейс, чтобы модель менялась настройкой. Тяжелую детерминированную обработку выносите в код, как сделал ИТ-руководитель банка: детерминированную обработку он вынес в отдельные приложения, остальное оставил агенту. Проектируйте цепочки короткими: в тесте сети магазинов задачу из двух шагов все три модели решили во всех прогонах, а на 15 шагах полностью проверяемого результата не дала ни одна, ни локальная, ни облачные.

Шаг 8. Мониторинг и обслуживание

Мониторинг температуры, ошибок памяти и времени ответа с первого дня. Резервные копии настроек и базы документов. План на отказ: запасная карта, договор аренды или переключение на облако для незакрытых данных. Ответственный человек, по нашей оценке, на 10–20% ставки для сервера отдела. Повторный экзамен на 50 запросах после каждого обновления.

Сроки и наша роль

По нашей оценке, шаги 1–5 занимают 2–4 недели, шаг 6 зависит от поставки железа, шаги 7–8 еще 2–4 недели. Мы делаем шаги 2–5 и 7 в пилоте за 14 дней от 150 000 ₽ на вашем или арендованном железе, а ИИ-отдел из 3–5 агентов на локальной модели за 4–6 недель от 450 000 ₽; железо покупаете вы по нашему расчету.

Вопросы и ответы

Можно ли пропустить пробу на аренде и сразу купить?

Можно, если задача типовая и модель до 32 млрд: рабочая станция или Mac Studio подойдут почти наверняка. Для сервера от 2 млн ₽ проба обязательна.

Сколько времени занимает установка модели?

По нашей оценке, на Mac или ноутбуке 10–30 минут. На сервере с vLLM день-два с настройкой и тестами, если инженер уже работал с видеокартами.

Источники и даты

  1. Tproger, облачные GPU для ML в 2026 году, 21.05.2026tproger.ru
  2. Intelion Cloud, аренда H100/H200 (проверено 29.09.2026)intelion.cloud
  3. store-apple.msk.ru, Mac Studio M4 Max 128 ГБ, 29.09.2026store-apple.msk.ru
  4. Регард, GeForce RTX 5090, цены на 29.09.2026regard.ru
  5. iXBT, RTX PRO 6000 Blackwell 96 ГБ за 1,08 млн ₽ в DNS, 02.02.2026ixbt.com
  6. Хабр (Slurm), зарплаты DevOps-инженеров, 03.09.2026habr.com
  7. GPU Индекс, аренда RTX 4090 в России: 173 предложения, от 31,75 ₽ в час (проверено 30.09.2026)gpuindex.ru
  8. GPU Индекс, аренда H100 в России: 41 предложение, от 242 ₽ в час (проверено 30.09.2026)gpuindex.ru
  9. Цифровые платформы, кейс №3502, 2 сентября 2026: Аэропорт Пулковоplatforms.su
  10. Цифровые платформы, кейс №3534, 2 сентября 2026: Агрохолдинг «Степь»platforms.su
  11. ComNews, девелопер MR внедрил ГигаЧат в проверку условий проектного финансирования, 15.09.2026, 15 сентября 2026: Девелопер MRcomnews.ru
  12. Цифровые платформы, кейс №3148, февраль 2026: Т2 (Tele2)platforms.su
  13. Цифровые платформы, кейс №4027, 2 сентября 2026: Фаберликplatforms.su
  14. Цифровые платформы, кейс №4085, 2 сентября 2026: Петрович-Техplatforms.su
  15. Цифровые платформы, кейс №2447, октябрь 2025: Т-Банкplatforms.su
  16. Цифровые платформы, кейс №3855, 2 сентября 2026: Т-Технологииplatforms.su
  17. Цифровые платформы, кейс №4067, 2 сентября 2026: Альфа-Банк, ИТ-руководительplatforms.su
Михаил Мозг

Михаил Мозг

Основатель MMOOZZGG, ИИ-директор

Подробнее о Михаиле@mmoozzggru

Кейсы по теме: 9

  • Кейс рынка · Россия

    Аэропорт Пулково ИИ-плагин безопасной разработки в закрытом контуре: точность более 90% на проверке находок и до 85% на исправлении

    Служба информационной безопасности аэропорта встроила анализ кода в среду разработки, а разбор уязвимостей и исправление кода передала обученному ИИ-плагину, который работает в закрытом контуре без выхода данных наружу. Точность модели более 90% на верификации находок и до 85% на исправлении уязвимостей.

    Промышленность и инфраструктура

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Агрохолдинг «Степь» собственная ИИ-экосистема на локальных нейросетях, чтобы не передавать данные в публичные сервисы

    Холдинг строит ИИ-экосистему на локальных нейросетях, агентах и чат-ботах, чтобы конфиденциальные данные не уходили в публичные сервисы. Реализована синхронизация данных управления стадом с государственной системой, развернут мониторинг правовой информации для бэк-офиса, запущено несколько аналитических проектов.

    Промышленность и инфраструктура

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Девелопер MR ИИ-контролер проектного финансирования в изолированном контуре: время на анализ кредитной документации меньше на 80%

    Девелопер вместе с банком внедрил ИИ-контролера на российской языковой модели для автоматической проверки условий проектного финансирования и мониторинга кредитных обязательств. По данным компании, время на анализ кредитной документации сократилось на 80%. Каждый крупный проект сопровождают сотни страниц кредитной документации и десятки дополнительных соглашений; система собирает мастер-версию каждого договора и ведет единый календарь обязательств.

    Промышленность и инфраструктура

    15 сентября 2026 · источник: comnews.ru

    Читать кейс
  • Кейс рынка · Россия

    Т2 (Tele2) тендер на ИИ-ассистента разработчика в закрытом ЦОД: 15 разработчиков, отклик не более 400 мс

    В феврале 2026 года оператор разместил тендер на автономного ИИ-ассистента для разработчиков, который разворачивается в закрытом дата-центре компании в Ростове-на-Дону, чтобы исходный код не покидал инфраструктуру. Требования: 15 пользователей, автодополнение с откликом не более 400 мс, шесть языков программирования.

    Связь

    2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Фаберлик нейросетевой поиск по каталогу на локальной модели Qwen и арендованных GPU

    Производитель косметики заменил классический поиск по каталогу нейросетевым: локальная языковая модель Qwen и векторный семантический поиск развернуты на GPU-инфраструктуре российского облака. Модель работает внутри контролируемой инфраструктуры, данные не передаются во внешние сервисы, затраты на обработку запросов под контролем.

    Ритейл и производство

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Петрович-Тех локальная модель на 9 млрд параметров сравнялась с облачными на задачах из 2–3 шагов: 27 прогонов

    ИТ-подразделение сети строительных магазинов сравнило три модели в единой агентной обвязке с 13 виджетами аналитической панели и около 30 инструментами: облачную западную модель, облачную открытую модель на 235 млрд параметров и локальную модель на 9 млрд параметров в 4-битной квантизации на одной видеокарте. Схема: 3 сценария, 3 модели, 3 прогона, 27 запусков.

    Ритейл и производство

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Т-Банк собственные LLM решают 45% обращений, по оценке затраты на поддержку ниже минимум на 25% в год

    Банк встроил в чат-бот собственные языковые модели семейства Gen-T: около 45% обращений клиентов решаются без оператора. В октябре 2025 года запущены ИИ-копайлоты для операторов первой линии, ими ежедневно пользуются более 90% сотрудников поддержки. Модели развернуты в периметре банка, данные вовне не передаются.

    Банки и финансы

    источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Т-Технологии ИИ-ассистент для задач с деньгами на собственных моделях Gen-T, бета с 20 июля 2026

    Группа разработала ИИ-ассистента для задач, связанных с деньгами и покупками, на собственных больших языковых моделях семейства Gen-T. Чтобы избежать выдумок, система опирается на верифицированные источники данных, а не только на знания модели. Бета представлена 20 июля 2026 года, полноценный запуск запланирован на осень.

    Банки и финансы

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Альфа-Банк, ИТ-руководитель локальный агент на модели Qwen 3.6-35B-A3B: около 70 токенов в секунду на Mac

    Автономный рабочий агент работает на локально развернутой модели с 35 млрд параметров и примерно 3 млрд активных на токен через LM Studio, скорость около 70 токенов в секунду на Mac. Сначала агент запускался в Docker на Mac, затем переехал на виртуальную машину, что стало переломным моментом по удобству.

    Банки и финансы

    2 сентября 2026 · источник: platforms.su

    Читать кейс
Все кейсы: 18

Цены и замеры в разделе проверены 29.09.2026 по источникам внизу страниц. Мы собираем ИИ-агентов на облачных и локальных моделях и не продаем железо. Расчеты оценочные, юридические выводы по 152-ФЗ и 243-ФЗ дает ваш юрист.

Контакты

Разберем, где вашей компании нужен локальный ИИ, а где хватит облака

Посчитаем железо, токены и людей на ваших цифрах и скажем честно, что дешевле. Бесплатно, 30 минут.

Telegram

@mmoozzggru

Ответим в течение рабочего дня. Все контакты

Написать в Telegram