собственные LLM решают 45% обращений, по оценке затраты на поддержку ниже минимум на 25% в год
Банки и финансы
источник: platforms.su
Читать кейсОсновы
Михаил Мозг2 минуты чтения
Токен это кусок слова: по данным Сбера, у GigaChat в одном токене в среднем 3–4 символа с пробелами, то есть страница текста в 1 800 знаков это около 450–600 токенов; у других моделей счет свой. Скорость генерации в токенах в секунду определяет, ждет ли человек ответа или нет. Ниже реальные замеры на Mac и видеокартах с датами и правило, сколько нужно для каждой задачи.
Замеры сообщества llama.cpp на модели 7–8 млрд параметров в 4-битной квантизации, таблица обновлена 25 августа 2026 года: M4 Pro с 20 ядрами GPU 50,7 токена в секунду, M4 Max с 40 ядрами 83,1, M3 Ultra с 80 ядрами 92,1, M5 Max с 40 ядрами 119,9. Обработка длинного запроса у M5 Max 3 220 токенов в секунду против 886 у M4 Max: новое поколение в 3,6 раза быстрее читает контекст. Модель 671 млрд параметров на Mac Studio M3 Ultra с 512 ГБ выдает 6,21 токена в секунду, а запрос на 8 000 токенов обрабатывает почти 15 минут.
Замеры мая 2024 года на модели 8 млрд в 4-битной квантизации: RTX 4090 127,7 токена в секунду, A100 138,3, H100 144,5, M2 Ultra 76,3. Модель 70 млрд в 4 битах: две RTX 4090 19,1, A100 22,1, H100 25,0, M2 Ultra 12,1. Один пользователь на серверной карте получает немногим больше, чем на игровой; преимущество серверных карт в объеме памяти и в обработке многих параллельных запросов.
Чат с человеком: по нашему практическому правилу, 15–20 токенов в секунду читаются как живой набор текста, а от 50 разница уже не заметна. Агент, который вызывает инструменты: важнее время обработки запроса, чем генерация, потому что контекст с документами перечитывается на каждом шаге; здесь M5 Max и серверные карты выигрывают. Пакетная обработка документов ночью: считайте суммарную выдачу, а не задержку. Персональный агент ИТ-руководителя банка работает на Mac со скоростью около 70 токенов в секунду.
Арендовать нужную карту почасово, на 30.09.2026 от 43 ₽ в час за RTX 4090 и от 242 ₽ за H100, и прогнать свои 50 запросов, или взять у знакомых Mac с нужной памятью. Замер на своей модели и своем контексте точнее любой таблицы.

Банки и финансы
источник: platforms.su
Читать кейсБанки и финансы
2 сентября 2026 · источник: platforms.su
Читать кейсБанки и финансы
2 сентября 2026 · источник: platforms.su
Читать кейсЦены и замеры в разделе проверены 29.09.2026 по источникам внизу страниц. Мы собираем ИИ-агентов на облачных и локальных моделях и не продаем железо. Расчеты оценочные, юридические выводы по 152-ФЗ и 243-ФЗ дает ваш юрист.
Контакты
Посчитаем железо, токены и людей на ваших цифрах и скажем честно, что дешевле. Бесплатно, 30 минут.