Сравнение

Когда облако выгоднее: семь случаев, где свое железо не окупится

Михаил Мозг3 минуты чтения

Облачный ИИ выгоднее локального в семи случаях, и раздел о суверенном ИИ обязан честно их перечислить. Мы собираем агентов и на облачных, и на локальных моделях, поэтому нам все равно, что вы выберете, лишь бы это было посчитано. Ниже семь случаев с расчетами и примерами.

1. Мало токенов

При 60 млн токенов в месяц дешевые облачные модели стоят 1 013–10 129 ₽, средние 20 258 ₽. Mac Studio за 886 757 ₽ при этом объеме окупается против Sonnet 5.5 за 71 месяц, против GPT-6 Luna никогда. По нашему расчету, свое железо начинает окупаться при сотнях миллионов токенов в месяц или при облачном счете от 70 000–100 000 ₽ в месяц.

2. Длинные цепочки шагов

На цепочках из 15 шагов в тесте сети магазинов полностью проверяемого результата не дала ни одна модель, а крупная облачная модель на 235 млрд справлялась частично вдвое чаще локальной на 9 млрд. Чем длиннее цепочка, тем важнее размер модели, а модель на 235 млрд, как в этом тесте, по нашему расчету требует у себя двух карт по 96 ГБ, это сервер от 2,5 млн ₽. Пока длинные цепочки надежно не решает ни одна модель, дешевле платить облаку по счету, даже 4 220 ₽ за миллион выходных токенов у флагманов, чем покупать сервер под такую задачу.

3. Нет инженера

Сервер отдела, по нашей оценке, требует 10–20% ставки DevOps при медиане 220 000–250 000 ₽, в Москве до 315 000 ₽ для инженера среднего уровня. Без человека сервер деградирует: обновление ломает совместимость, карта греется, никто не смотрит логи. Если нанимать некого, облако или аренда с поддержкой провайдера.

4. Нагрузка сезонная или пиковая

Железо стоит одинаково в сезон и вне сезона, облако берет только за токены. Аренда H100 на два месяца в сезон стоит от 290 000 ₽ по помесячному тарифу, покупка 2,29 млн ₽ плюс сервер: при пике два месяца в году покупка проигрывает 5 лет.

5. Нужны зрение, речь и текст сразу

Локально это, как правило, отдельные модели для зрения, речи и текста, память под каждую и свои движки. В облаке одна модель принимает картинку, документ и текст. Пока задача не сформулирована, облако дешевле на этапе поиска решения.

6. Данные можно выпускать

Если в запросах нет персональных данных, кода, финансов и медицины, или есть договор поручения с российским провайдером по 152-ФЗ, главный аргумент за свое железо исчезает. Российские облака дают договор с российским юрлицом и данные в России.

7. Вы только начинаете

Пилот на облаке за 14 дней покажет объем токенов, длину цепочек и качество на ваших данных; только после этого цифры для калькуляторов становятся вашими, а не средними. Покупка железа до пилота это покупка вслепую.

Как проверить за неделю

Прогоните 50 своих запросов на облачной средней модели и на открытой модели 8–32 млрд на арендованной карте за 43–565 ₽ в час, сравните качество и посчитайте токены. Подставьте объем в калькуляторы. Если локальный итог выше облачного и данные могут выходить наружу, ответ облако, и это хороший ответ.

Вопросы и ответы

А если провайдер поднимет цены или закроет доступ?

Это реальный риск для зарубежных API: OpenAI с 9 июля 2024 года блокирует API-трафик из неподдерживаемых стран, в их числе Россия. Ответ на него не покупка сервера, а агенты с единым интерфейсом модели, которые переезжают настройкой на российское облако или локальную модель.

Источники и даты

Михаил Мозг

Михаил Мозг

Основатель MMOOZZGG, ИИ-директор

Подробнее о Михаиле@mmoozzggru

Кейсы по теме: 2

  • Кейс рынка · Россия

    Фаберлик нейросетевой поиск по каталогу на локальной модели Qwen и арендованных GPU

    Производитель косметики заменил классический поиск по каталогу нейросетевым: локальная языковая модель Qwen и векторный семантический поиск развернуты на GPU-инфраструктуре российского облака. Модель работает внутри контролируемой инфраструктуры, данные не передаются во внешние сервисы, затраты на обработку запросов под контролем.

    Ритейл и производство

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Петрович-Тех локальная модель на 9 млрд параметров сравнялась с облачными на задачах из 2–3 шагов: 27 прогонов

    ИТ-подразделение сети строительных магазинов сравнило три модели в единой агентной обвязке с 13 виджетами аналитической панели и около 30 инструментами: облачную западную модель, облачную открытую модель на 235 млрд параметров и локальную модель на 9 млрд параметров в 4-битной квантизации на одной видеокарте. Схема: 3 сценария, 3 модели, 3 прогона, 27 запусков.

    Ритейл и производство

    2 сентября 2026 · источник: platforms.su

    Читать кейс
Все кейсы: 18

Цены и замеры в разделе проверены 29.09.2026 по источникам внизу страниц. Мы собираем ИИ-агентов на облачных и локальных моделях и не продаем железо. Расчеты оценочные, юридические выводы по 152-ФЗ и 243-ФЗ дает ваш юрист.

Контакты

Разберем, где вашей компании нужен локальный ИИ, а где хватит облака

Посчитаем железо, токены и людей на ваших цифрах и скажем честно, что дешевле. Бесплатно, 30 минут.

Telegram

@mmoozzggru

Ответим в течение рабочего дня. Все контакты

Написать в Telegram