Калькулятор

Стоимость токена на своем сервере: сколько стоит миллион токенов

Михаил Мозг3 минуты чтения

Облако продает токены по цене за миллион, и стоимость токена на своем сервере можно посчитать в той же единице. Калькулятор берет расходы в месяц и скорость выдачи, учитывает загрузку и показывает вашу цену за миллион токенов рядом с ценами облачных моделей на 29.09.2026.

Калькулятор

Сколько стоит миллион токенов на своем железе

Ваша цена

  • Токенов в месяц64,6 млн
  • Рублей за миллион токенов501 ₽
  • Долларов за миллион$5,94

Замеры одного потока: M4 Max 83,1 и M5 Max 119,9 токена в секунду на модели 7B, RTX 4090 127,7 и H100 144,5 на модели 8B; на модели 70B 19–25.

Облако за миллион выходных токенов, ₽

  • GPT-6 Luna42 ₽
  • GigaChat Lite, синхронно65 ₽
  • YandexGPT Lite, асинхронно100 ₽
  • Gemini 3.1 Flash-Lite127 ₽
  • YandexGPT Lite, синхронно200 ₽
  • Gemini 3.8 Flash (акция до 31.12.2026)317 ₽
  • GigaChat Max, асинхронно325 ₽
  • GPT-5.4 mini380 ₽
  • Claude Haiku 4.5422 ₽
  • GigaChat Pro, синхронно500 ₽
  • YandexGPT Pro 5, асинхронно610 ₽
  • GigaChat Max, синхронно650 ₽
  • Claude Sonnet 5.5844 ₽
  • GPT-6 Sol844 ₽
  • Gemini 3.1 Pro (до 200k)1 013 ₽
  • YandexGPT Pro 5, синхронно1 200 ₽
  • Claude Opus 5.51 688 ₽
  • GPT-5.52 532 ₽
  • Claude Fable 5.14 220 ₽
  • GPT-6 Astra4 220 ₽

Строки без затемнения дороже вашей цены за миллион.

Значения по умолчанию из источников на 29.09.2026; курс ЦБ 84,41 ₽ за доллар. Расчет оценочный, любое поле можно изменить.

Формула

Токенов в месяц: скорость в токенах в секунду, умноженная на 2 592 000 секунд в месяце и на долю времени, когда модель реально генерирует. Цена миллиона: расходы в месяц из калькулятора локального ИИ, деленные на число миллионов. Скорость берите из замеров: для одного пользователя это 19–145 токенов в секунду на моделях 7–70 млрд, для пакетной выдачи на серверной карте суммарно, по нашей оценке, в десятки раз больше, и это главный рычаг.

Примеры по ценам на 29.09.2026

Mac Studio M4 Max при 32 400 ₽ в месяц, модель 7 млрд (Llama 2 7B в 4 битах), 83 токена в секунду, генерация 30% времени: 64,6 млн токенов и 501 ₽ за миллион, около 5,9 доллара. Рабочая станция с RTX 5090 при 66 200 ₽ в месяц, 128 токенов в секунду по замеру RTX 4090 на модели 8 млрд (замера RTX 5090 в источниках нет), 50% времени: 165 млн токенов, 400 ₽ за миллион. Модель 70 млрд в 4 битах занимает около 38,5 ГБ и на одну RTX 5090 с 32 ГБ не помещается; станция с двумя RTX 5090 стоит около 94 900 ₽ в месяц, и при 19 токенах в секунду по замеру двух RTX 4090 это 24,8 млн токенов и 3 833 ₽ за миллион, дороже выходных токенов Opus 5.5 по 1 688 ₽. Арендованная H100 за 242 ₽ в час на модели 70 млрд при 25 токенах в секунду и 80% загрузке: 3 361 ₽ за миллион; на модели 8 млрд при 144,5 токена в секунду 581 ₽. Сервер с четырьмя H100 при 507 000 ₽ в месяц и пакетной выдаче 2 000 токенов в секунду суммарно (наше допущение) при 60% загрузке: 3,1 млрд токенов и 163 ₽ за миллион, около 2 долларов.

Что из этого следует

Один пользователь на локальной модели 7–8 млрд платит 380–500 ₽ за миллион токенов: это уровень облачных моделей среднего класса за выходные токены, Haiku 4.5 422 ₽ и GPT-5.4 mini 380 ₽, и в 9–12 раз дороже дешевых, GPT-6 Luna 42 ₽. Пакетная выдача для десятков пользователей на серверной карте опускает цену до 163 ₽ в примере с четырьмя H100, дешевле облачных моделей среднего класса за выходные токены, при полном контроле над данными. Модель 70 млрд для одного пользователя стоит 3 360–3 540 ₽ за миллион, как облачные флагманы: ее берут ради данных, а не ради цены.

Как измерить свою скорость

Арендуйте нужную карту на час: RTX 4090 от 43 ₽, H100 от 242 ₽ в час, поставьте движок выдачи и прогоните 50 своих запросов при 1, 4 и 16 параллельных потоках: суммарная скорость при 16 потоках и есть число для калькулятора. На Mac измерьте в LM Studio: скорость показывается после каждого ответа.

Вопросы и ответы

Почему загрузка 30–60%, а не 100%?

Модель ждет запросов ночью и между диалогами. По оценке из отраслевой публикации, цена токена остается разумной при загрузке не ниже 80–90%, а без очереди задач такой загрузки достичь трудно.

Считать входные токены?

Обработка запроса идет намного быстрее генерации: на M5 Max 3 220 токенов в секунду против 120, в 27 раз. Поэтому в грубом расчете входные токены почти бесплатны; для длинных документов замерьте время обработки запроса на своей карте и добавьте его к загрузке.

Источники и даты

Михаил Мозг

Михаил Мозг

Основатель MMOOZZGG, ИИ-директор

Подробнее о Михаиле@mmoozzggru

Цены и замеры в разделе проверены 29.09.2026 по источникам внизу страниц. Мы собираем ИИ-агентов на облачных и локальных моделях и не продаем железо. Расчеты оценочные, юридические выводы по 152-ФЗ и 243-ФЗ дает ваш юрист.

Контакты

Разберем, где вашей компании нужен локальный ИИ, а где хватит облака

Посчитаем железо, токены и людей на ваших цифрах и скажем честно, что дешевле. Бесплатно, 30 минут.

Telegram

@mmoozzggru

Ответим в течение рабочего дня. Все контакты

Написать в Telegram