Калькулятор
Стоимость токена на своем сервере: сколько стоит миллион токенов
Михаил Мозг3 минуты чтения
Облако продает токены по цене за миллион, и стоимость токена на своем сервере можно посчитать в той же единице. Калькулятор берет расходы в месяц и скорость выдачи, учитывает загрузку и показывает вашу цену за миллион токенов рядом с ценами облачных моделей на 29.09.2026.
Калькулятор
Сколько стоит миллион токенов на своем железе
Ваша цена
- Токенов в месяц64,6 млн
- Рублей за миллион токенов501 ₽
- Долларов за миллион$5,94
Замеры одного потока: M4 Max 83,1 и M5 Max 119,9 токена в секунду на модели 7B, RTX 4090 127,7 и H100 144,5 на модели 8B; на модели 70B 19–25.
Облако за миллион выходных токенов, ₽
- GPT-6 Luna42 ₽
- GigaChat Lite, синхронно65 ₽
- YandexGPT Lite, асинхронно100 ₽
- Gemini 3.1 Flash-Lite127 ₽
- YandexGPT Lite, синхронно200 ₽
- Gemini 3.8 Flash (акция до 31.12.2026)317 ₽
- GigaChat Max, асинхронно325 ₽
- GPT-5.4 mini380 ₽
- Claude Haiku 4.5422 ₽
- GigaChat Pro, синхронно500 ₽
- YandexGPT Pro 5, асинхронно610 ₽
- GigaChat Max, синхронно650 ₽
- Claude Sonnet 5.5844 ₽
- GPT-6 Sol844 ₽
- Gemini 3.1 Pro (до 200k)1 013 ₽
- YandexGPT Pro 5, синхронно1 200 ₽
- Claude Opus 5.51 688 ₽
- GPT-5.52 532 ₽
- Claude Fable 5.14 220 ₽
- GPT-6 Astra4 220 ₽
Строки без затемнения дороже вашей цены за миллион.
Значения по умолчанию из источников на 29.09.2026; курс ЦБ 84,41 ₽ за доллар. Расчет оценочный, любое поле можно изменить.
Формула
Токенов в месяц: скорость в токенах в секунду, умноженная на 2 592 000 секунд в месяце и на долю времени, когда модель реально генерирует. Цена миллиона: расходы в месяц из калькулятора локального ИИ, деленные на число миллионов. Скорость берите из замеров: для одного пользователя это 19–145 токенов в секунду на моделях 7–70 млрд, для пакетной выдачи на серверной карте суммарно, по нашей оценке, в десятки раз больше, и это главный рычаг.
Примеры по ценам на 29.09.2026
Mac Studio M4 Max при 32 400 ₽ в месяц, модель 7 млрд (Llama 2 7B в 4 битах), 83 токена в секунду, генерация 30% времени: 64,6 млн токенов и 501 ₽ за миллион, около 5,9 доллара. Рабочая станция с RTX 5090 при 66 200 ₽ в месяц, 128 токенов в секунду по замеру RTX 4090 на модели 8 млрд (замера RTX 5090 в источниках нет), 50% времени: 165 млн токенов, 400 ₽ за миллион. Модель 70 млрд в 4 битах занимает около 38,5 ГБ и на одну RTX 5090 с 32 ГБ не помещается; станция с двумя RTX 5090 стоит около 94 900 ₽ в месяц, и при 19 токенах в секунду по замеру двух RTX 4090 это 24,8 млн токенов и 3 833 ₽ за миллион, дороже выходных токенов Opus 5.5 по 1 688 ₽. Арендованная H100 за 242 ₽ в час на модели 70 млрд при 25 токенах в секунду и 80% загрузке: 3 361 ₽ за миллион; на модели 8 млрд при 144,5 токена в секунду 581 ₽. Сервер с четырьмя H100 при 507 000 ₽ в месяц и пакетной выдаче 2 000 токенов в секунду суммарно (наше допущение) при 60% загрузке: 3,1 млрд токенов и 163 ₽ за миллион, около 2 долларов.
Что из этого следует
Один пользователь на локальной модели 7–8 млрд платит 380–500 ₽ за миллион токенов: это уровень облачных моделей среднего класса за выходные токены, Haiku 4.5 422 ₽ и GPT-5.4 mini 380 ₽, и в 9–12 раз дороже дешевых, GPT-6 Luna 42 ₽. Пакетная выдача для десятков пользователей на серверной карте опускает цену до 163 ₽ в примере с четырьмя H100, дешевле облачных моделей среднего класса за выходные токены, при полном контроле над данными. Модель 70 млрд для одного пользователя стоит 3 360–3 540 ₽ за миллион, как облачные флагманы: ее берут ради данных, а не ради цены.
Как измерить свою скорость
Арендуйте нужную карту на час: RTX 4090 от 43 ₽, H100 от 242 ₽ в час, поставьте движок выдачи и прогоните 50 своих запросов при 1, 4 и 16 параллельных потоках: суммарная скорость при 16 потоках и есть число для калькулятора. На Mac измерьте в LM Studio: скорость показывается после каждого ответа.
Вопросы и ответы
Почему загрузка 30–60%, а не 100%?
Считать входные токены?
Источники и даты
- llama.cpp, производительность на Apple Silicon, таблица обновлена 25.08.2026github.com
- GPU-Benchmarks-on-LLM-Inference, Llama 3 8B и 70B, май 2024github.com
- Intelion Cloud, аренда H100/H200 (проверено 29.09.2026)intelion.cloud
- Tproger, облачные GPU для ML в 2026 году, 21.05.2026tproger.ru
- Claude Platform, цены API (проверено 29.09.2026)platform.claude.com
- Puter, обзор цен OpenAI API по данным openai.com, 29.09.2026developer.puter.com
- ComNews, локальные ИИ и стоимость автоматизации, 19.02.2026comnews.ru
- GPU Индекс, аренда RTX 4090 в России: 173 предложения, от 31,75 ₽ в час (проверено 30.09.2026)gpuindex.ru
- GPU Индекс, аренда H100 в России: 41 предложение, от 242 ₽ в час (проверено 30.09.2026)gpuindex.ru
- Регард, GeForce RTX 5090: одна карта в продаже, 30.09.2026regard.ru

Цены и замеры в разделе проверены 29.09.2026 по источникам внизу страниц. Мы собираем ИИ-агентов на облачных и локальных моделях и не продаем железо. Расчеты оценочные, юридические выводы по 152-ФЗ и 243-ФЗ дает ваш юрист.
Контакты
Разберем, где вашей компании нужен локальный ИИ, а где хватит облака
Посчитаем железо, токены и людей на ваших цифрах и скажем честно, что дешевле. Бесплатно, 30 минут.