Архитектура

ИИ на своих серверах: три уровня и что выбрать

Михаил Мозг2 минуты чтения

ИИ на своих серверах, или локальное развертывание (по-английски on-premise), означает, что модель работает на вашем железе, а сеть при этом может быть открытой: обновления и внешние источники доступны. Ниже три уровня по числу пользователей с ценами и кто на каком уровне работает.

Чем отличается

От закрытого контура: есть интернет, значит проще обновлять и можно гибридно ходить в облако для обезличенных задач; требования безопасности мягче. От аренды GPU: железо ваше, против аренды окупается только при высокой постоянной загрузке, срок покажет калькулятор окупаемости; требует инженера и места. От российского облака: контур ваш, третьих лиц нет, договор поручения не нужен.

Уровень 1: один компьютер, 1–3 пользователя

Mac Studio M4 Max со 128 ГБ за 886 757 ₽ или рабочая станция с RTX 5090 около 1,1 млн ₽. Модели до 70 млрд на Mac и до 32 млрд на RTX 5090, LM Studio или Ollama, около 32 400–66 200 ₽ в месяц полной стоимости по нашему расчету. ИТ-руководитель банка гоняет персонального агента на Mac при скорости около 70 токенов в секунду.

Уровень 2: сервер отдела, 10–20 пользователей

Сервер с двумя RTX PRO 6000 по 96 ГБ около 2,5 млн ₽, vLLM, около 176 000 ₽ в месяц с размещением и инженером по нашему расчету. Модели 70 млрд в 16 битах или 235 млрд в 4 битах, очередь агентов. Юридический департамент ИТ-холдинга на своей модели сократил согласование договоров с двух недель до трех дней.

Уровень 3: серверные карты, сотни пользователей

Сервер с четырьмя H100 от 10 млн ₽, около 507 000 ₽ в месяц по нашему расчету, или несколько таких серверов. Банк на собственных моделях решает около 45% обращений без оператора и оценивает снижение затрат на поддержку минимум на 25%. По оценке из отраслевой публикации, сервер на 1 000 одновременных пользователей стоит порядка 55 млн ₽ и окупается при загрузке 80–90%.

Платформа или сборка

Интеграторы продают локальный ИИ как платформу с интерфейсом, конвейерами и правами доступа; так группа ЛАНИТ представила платформу для развертывания моделей на инфраструктуре заказчика. Сборка из открытых компонентов дешевле в лицензиях и требует инженера. Мы собираем из открытых компонентов и передаем вашему инженеру с документацией.

Вопросы и ответы

Нужен ли свой дата-центр?

Для уровней 1 и 2 нет: Mac стоит на столе, сервер отдела можно разместить в коммерческом дата-центре от 7 500 ₽ в месяц за сервер до 300 Вт. Сервер уровня 3 на 3,8 кВт по тому же тарифу обойдется примерно в 77 500 ₽ в месяц по нашему расчету; закрытый контур требует отдельной сети без интернета.

Как считать окупаемость?

Калькулятор точки окупаемости: цена железа, расходы в месяц, счет за облако. Для уровня 1 окупаемость есть только против дорогих моделей, для крупного сервера, по оценке из отраслевой публикации, при загрузке 80–90%.

Источники и даты

  1. store-apple.msk.ru, Mac Studio M4 Max 128 ГБ, 29.09.2026store-apple.msk.ru
  2. Регард, GeForce RTX 5090, цены на 29.09.2026regard.ru
  3. iXBT, RTX PRO 6000 Blackwell 96 ГБ за 1,08 млн ₽ в DNS, 02.02.2026ixbt.com
  4. Servermall, NVIDIA H100 SXM5 80 ГБ, цена на 29.09.2026servermall.ru
  5. HOSTKEY, colocation в Москве, 2026hostkey.ru
  6. ComNews, локальные ИИ и стоимость автоматизации, 19.02.2026comnews.ru
  7. Хабр (Slurm), зарплаты DevOps-инженеров, 03.09.2026habr.com
  8. Цифровые платформы, кейс №2447, октябрь 2025: Т-Банкplatforms.su
  9. Цифровые платформы, кейс №3855, 2 сентября 2026: Т-Технологииplatforms.su
  10. Цифровые платформы, кейс №4067, 2 сентября 2026: Альфа-Банк, ИТ-руководительplatforms.su
  11. Цифровые платформы, кейс №2929, 2025: ИТ-холдинг Т1platforms.su
  12. Цифровые платформы, кейс №3475, 2 сентября 2026: НСИС, оператор АИС страхованияplatforms.su
  13. Цифровые платформы, кейс №3661, 2 сентября 2026: Digital Sector и заказчик из ИТ-инфраструктурыplatforms.su
  14. Цифровые платформы, кейс №4084, 2 сентября 2026: VK Techplatforms.su
  15. Цифровые платформы, кейс №2874, 2025: ЛАНИТplatforms.su
Михаил Мозг

Михаил Мозг

Основатель MMOOZZGG, ИИ-директор

Подробнее о Михаиле@mmoozzggru

Кейсы по теме: 8

  • Кейс рынка · Россия

    Т-Банк собственные LLM решают 45% обращений, по оценке затраты на поддержку ниже минимум на 25% в год

    Банк встроил в чат-бот собственные языковые модели семейства Gen-T: около 45% обращений клиентов решаются без оператора. В октябре 2025 года запущены ИИ-копайлоты для операторов первой линии, ими ежедневно пользуются более 90% сотрудников поддержки. Модели развернуты в периметре банка, данные вовне не передаются.

    Банки и финансы

    источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Т-Технологии ИИ-ассистент для задач с деньгами на собственных моделях Gen-T, бета с 20 июля 2026

    Группа разработала ИИ-ассистента для задач, связанных с деньгами и покупками, на собственных больших языковых моделях семейства Gen-T. Чтобы избежать выдумок, система опирается на верифицированные источники данных, а не только на знания модели. Бета представлена 20 июля 2026 года, полноценный запуск запланирован на осень.

    Банки и финансы

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Альфа-Банк, ИТ-руководитель локальный агент на модели Qwen 3.6-35B-A3B: около 70 токенов в секунду на Mac

    Автономный рабочий агент работает на локально развернутой модели с 35 млрд параметров и примерно 3 млрд активных на токен через LM Studio, скорость около 70 токенов в секунду на Mac. Сначала агент запускался в Docker на Mac, затем переехал на виртуальную машину, что стало переломным моментом по удобству.

    Банки и финансы

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    ИТ-холдинг Т1 согласование договоров за 3 дня вместо двух недель, затраты на сравнение документов ниже на 40%

    Юридический департамент холдинга, более 70 юристов, больше года обучал собственную языковую модель на юридических данных компании. Согласование договоров сократилось с двух недель до трех дней, сравнение двух версий документа выполняется в пять раз быстрее, чем вручную.

    ИТ-компании

    источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    НСИС, оператор АИС страхования обработка обращений в 20 раз быстрее на локальной LLM, рост обращений в 1,5 раза без найма

    Оператор национальной страховой информационной системы развернул большую языковую модель локально и построил на ней три контура: автоматическую обработку обращений с множественными полями, RAG-сервис технической поддержки на документах компании и ИИ-агентов в процессе разработки, включая автоматический код-ревью.

    ИТ-компании

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Digital Sector и заказчик из ИТ-инфраструктуры ИИ-агент анализа договоров в закрытом контуре заказчика; во внутреннем тестировании интегратора агенты высвободили 20% времени команды

    Интегратор реализовал ИИ-агента для первичного анализа договоров в закрытом контуре заказчика, который проектирует и поставляет ИТ-инфраструктуру: агент извлекает и сопоставляет данные, выявляет расхождения и готовит результат для специалиста. Агентов интегратор внедрил и в собственные процессы тестирования: высвобождено 20% рабочего времени команды за спринт.

    ИТ-компании

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    VK Tech две модели уместились в 22,4 ГБ из 24 ГБ видеопамяти при контексте 65 536 токенов

    Команда собрала локального ИИ-агента в закрытом контуре на связке Ollama и агентной обвязки на арендованном GPU-сервере с картой NVIDIA A30 на 24 ГБ. Модели: gpt-oss 20b (13 ГБ) для текста и инструментов и qwen3-vl 8b (6,1 ГБ) для изображений; вместе с KV-кэшем на контекст 65 536 токенов занято 22,4 ГБ.

    ИТ-компании

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    ЛАНИТ сбор требований в 4 раза быстрее, время поиска документов на 66% меньше на платформе локальных LLM

    Группа разработала платформу для локального развертывания больших языковых моделей на инфраструктуре заказчика: чат и сложные конвейеры обработки документов, аудио и изображений. Дочерняя компания создала собственную модель, дообученную на русскоязычных данных, и пилотирует ее в CRM-, SRM- и HRM-проектах и корпоративных чат-ботах.

    ИТ-компании

    источник: platforms.su

    Читать кейс
Все кейсы: 18

Цены и замеры в разделе проверены 29.09.2026 по источникам внизу страниц. Мы собираем ИИ-агентов на облачных и локальных моделях и не продаем железо. Расчеты оценочные, юридические выводы по 152-ФЗ и 243-ФЗ дает ваш юрист.

Контакты

Разберем, где вашей компании нужен локальный ИИ, а где хватит облака

Посчитаем железо, токены и людей на ваших цифрах и скажем честно, что дешевле. Бесплатно, 30 минут.

Telegram

@mmoozzggru

Ответим в течение рабочего дня. Все контакты

Написать в Telegram