Основы

Скорость локальной модели: что значит «токенов в секунду» и сколько нужно вам

Михаил Мозг2 минуты чтения

Токен это кусок слова: по данным Сбера, у GigaChat в одном токене в среднем 3–4 символа с пробелами, то есть страница текста в 1 800 знаков это около 450–600 токенов; у других моделей счет свой. Скорость генерации в токенах в секунду определяет, ждет ли человек ответа или нет. Ниже реальные замеры на Mac и видеокартах с датами и правило, сколько нужно для каждой задачи.

Apple Silicon

Замеры сообщества llama.cpp на модели 7–8 млрд параметров в 4-битной квантизации, таблица обновлена 25 августа 2026 года: M4 Pro с 20 ядрами GPU 50,7 токена в секунду, M4 Max с 40 ядрами 83,1, M3 Ultra с 80 ядрами 92,1, M5 Max с 40 ядрами 119,9. Обработка длинного запроса у M5 Max 3 220 токенов в секунду против 886 у M4 Max: новое поколение в 3,6 раза быстрее читает контекст. Модель 671 млрд параметров на Mac Studio M3 Ultra с 512 ГБ выдает 6,21 токена в секунду, а запрос на 8 000 токенов обрабатывает почти 15 минут.

Видеокарты

Замеры мая 2024 года на модели 8 млрд в 4-битной квантизации: RTX 4090 127,7 токена в секунду, A100 138,3, H100 144,5, M2 Ultra 76,3. Модель 70 млрд в 4 битах: две RTX 4090 19,1, A100 22,1, H100 25,0, M2 Ultra 12,1. Один пользователь на серверной карте получает немногим больше, чем на игровой; преимущество серверных карт в объеме памяти и в обработке многих параллельных запросов.

Сколько нужно

Чат с человеком: по нашему практическому правилу, 15–20 токенов в секунду читаются как живой набор текста, а от 50 разница уже не заметна. Агент, который вызывает инструменты: важнее время обработки запроса, чем генерация, потому что контекст с документами перечитывается на каждом шаге; здесь M5 Max и серверные карты выигрывают. Пакетная обработка документов ночью: считайте суммарную выдачу, а не задержку. Персональный агент ИТ-руководителя банка работает на Mac со скоростью около 70 токенов в секунду.

Как проверить перед покупкой

Арендовать нужную карту почасово, на 30.09.2026 от 43 ₽ в час за RTX 4090 и от 242 ₽ за H100, и прогнать свои 50 запросов, или взять у знакомых Mac с нужной памятью. Замер на своей модели и своем контексте точнее любой таблицы.

Вопросы и ответы

Почему при длинном документе модель долго думает перед ответом?

Это обработка запроса: модель читает весь контекст перед первым токеном. На Mac Studio M3 Ultra запрос на 8 000 токенов к модели 671 млрд занял 888 секунд.

Источники и даты

Михаил Мозг

Михаил Мозг

Основатель MMOOZZGG, ИИ-директор

Подробнее о Михаиле@mmoozzggru

Кейсы по теме: 3

  • Кейс рынка · Россия

    Т-Банк собственные LLM решают 45% обращений, по оценке затраты на поддержку ниже минимум на 25% в год

    Банк встроил в чат-бот собственные языковые модели семейства Gen-T: около 45% обращений клиентов решаются без оператора. В октябре 2025 года запущены ИИ-копайлоты для операторов первой линии, ими ежедневно пользуются более 90% сотрудников поддержки. Модели развернуты в периметре банка, данные вовне не передаются.

    Банки и финансы

    источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Т-Технологии ИИ-ассистент для задач с деньгами на собственных моделях Gen-T, бета с 20 июля 2026

    Группа разработала ИИ-ассистента для задач, связанных с деньгами и покупками, на собственных больших языковых моделях семейства Gen-T. Чтобы избежать выдумок, система опирается на верифицированные источники данных, а не только на знания модели. Бета представлена 20 июля 2026 года, полноценный запуск запланирован на осень.

    Банки и финансы

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Альфа-Банк, ИТ-руководитель локальный агент на модели Qwen 3.6-35B-A3B: около 70 токенов в секунду на Mac

    Автономный рабочий агент работает на локально развернутой модели с 35 млрд параметров и примерно 3 млрд активных на токен через LM Studio, скорость около 70 токенов в секунду на Mac. Сначала агент запускался в Docker на Mac, затем переехал на виртуальную машину, что стало переломным моментом по удобству.

    Банки и финансы

    2 сентября 2026 · источник: platforms.su

    Читать кейс
Все кейсы: 18

Цены и замеры в разделе проверены 29.09.2026 по источникам внизу страниц. Мы собираем ИИ-агентов на облачных и локальных моделях и не продаем железо. Расчеты оценочные, юридические выводы по 152-ФЗ и 243-ФЗ дает ваш юрист.

Контакты

Разберем, где вашей компании нужен локальный ИИ, а где хватит облака

Посчитаем железо, токены и людей на ваших цифрах и скажем честно, что дешевле. Бесплатно, 30 минут.

Telegram

@mmoozzggru

Ответим в течение рабочего дня. Все контакты

Написать в Telegram