Основы

Сколько памяти нужно модели: считаем на пальцах и на реальном железе

Михаил Мозг2 минуты чтения

Сколько памяти нужно модели и поместится ли она, решает одна формула: параметры, умноженные на байты на параметр, плюс кэш контекста, плюс запас. Ниже формула, таблица по размерам и подтверждение из реального кейса, где две модели уместили в 24 ГБ видеопамяти.

Формула

Веса: число параметров, умноженное на байты на параметр: 2 байта в FP16, 1 байт в 8-битной квантизации, около 0,55 байта в 4-битной с учетом служебных данных. KV-кэш: память под контекст, растет линейно с длиной контекста и зависит от архитектуры; по нашему практическому правилу, для моделей на 8 млрд параметров это порядка 0,13 МБ на токен, на 30–70 млрд порядка 0,25–0,33 МБ на токен. Запас по нашему правилу: 10–20% на рабочие буферы и систему.

Ориентиры по размерам в 4-битной квантизации

8 млрд параметров: около 5 ГБ весов, работает на ноутбуке с 16 ГБ. 20–35 млрд: 12–20 ГБ, одна карта на 24–32 ГБ или Mac с 36–64 ГБ. 70 млрд: около 40 ГБ, две карты на 24 ГБ, одна на 96 ГБ или Mac с 64–128 ГБ. 235 млрд: около 130 ГБ, Mac Studio с 256–512 ГБ или несколько серверных карт. 671 млрд: около 405 ГБ по замеру для 4-битной версии, Mac Studio с 512 ГБ, где такая модель выдает 6,21 токена в секунду.

Реальный пример

Команда облачного провайдера уместила на карте с 24 ГБ две модели при контексте 65 536 токенов: веса текстовой модели 13,0 ГБ, ее KV-кэш 0,9 ГБ, веса модели зрения 6,1 ГБ, ее KV-кэш 2,4 ГБ, итого 22,4 ГБ из 24. Запас в 1,6 ГБ оказался достаточным для однопользовательского режима.

Что это значит при покупке

Память важнее скорости: модель, которая не поместилась, не работает вообще, а медленная работает. Поэтому в Mac ценят единую память до 512 ГБ, а в видеокартах объем 24, 32, 80 и 96 ГБ. Несколько пользователей одновременно умножают KV-кэш: для 10 параллельных диалогов по 8 000 токенов на модели 32 млрд нужно еще около 20 ГБ.

Вопросы и ответы

Можно ли запустить модель, если памяти чуть не хватает?

Часть слоев уходит в оперативную память или на диск, скорость падает в разы. Лучше взять квантизацию ниже или модель меньше.

Источники и даты

Михаил Мозг

Михаил Мозг

Основатель MMOOZZGG, ИИ-директор

Подробнее о Михаиле@mmoozzggru

Кейсы по теме: 5

  • Кейс рынка · Россия

    ИТ-холдинг Т1 согласование договоров за 3 дня вместо двух недель, затраты на сравнение документов ниже на 40%

    Юридический департамент холдинга, более 70 юристов, больше года обучал собственную языковую модель на юридических данных компании. Согласование договоров сократилось с двух недель до трех дней, сравнение двух версий документа выполняется в пять раз быстрее, чем вручную.

    ИТ-компании

    источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    НСИС, оператор АИС страхования обработка обращений в 20 раз быстрее на локальной LLM, рост обращений в 1,5 раза без найма

    Оператор национальной страховой информационной системы развернул большую языковую модель локально и построил на ней три контура: автоматическую обработку обращений с множественными полями, RAG-сервис технической поддержки на документах компании и ИИ-агентов в процессе разработки, включая автоматический код-ревью.

    ИТ-компании

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Digital Sector и заказчик из ИТ-инфраструктуры ИИ-агент анализа договоров в закрытом контуре заказчика; во внутреннем тестировании интегратора агенты высвободили 20% времени команды

    Интегратор реализовал ИИ-агента для первичного анализа договоров в закрытом контуре заказчика, который проектирует и поставляет ИТ-инфраструктуру: агент извлекает и сопоставляет данные, выявляет расхождения и готовит результат для специалиста. Агентов интегратор внедрил и в собственные процессы тестирования: высвобождено 20% рабочего времени команды за спринт.

    ИТ-компании

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    VK Tech две модели уместились в 22,4 ГБ из 24 ГБ видеопамяти при контексте 65 536 токенов

    Команда собрала локального ИИ-агента в закрытом контуре на связке Ollama и агентной обвязки на арендованном GPU-сервере с картой NVIDIA A30 на 24 ГБ. Модели: gpt-oss 20b (13 ГБ) для текста и инструментов и qwen3-vl 8b (6,1 ГБ) для изображений; вместе с KV-кэшем на контекст 65 536 токенов занято 22,4 ГБ.

    ИТ-компании

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    ЛАНИТ сбор требований в 4 раза быстрее, время поиска документов на 66% меньше на платформе локальных LLM

    Группа разработала платформу для локального развертывания больших языковых моделей на инфраструктуре заказчика: чат и сложные конвейеры обработки документов, аудио и изображений. Дочерняя компания создала собственную модель, дообученную на русскоязычных данных, и пилотирует ее в CRM-, SRM- и HRM-проектах и корпоративных чат-ботах.

    ИТ-компании

    источник: platforms.su

    Читать кейс
Все кейсы: 18

Цены и замеры в разделе проверены 29.09.2026 по источникам внизу страниц. Мы собираем ИИ-агентов на облачных и локальных моделях и не продаем железо. Расчеты оценочные, юридические выводы по 152-ФЗ и 243-ФЗ дает ваш юрист.

Контакты

Разберем, где вашей компании нужен локальный ИИ, а где хватит облака

Посчитаем железо, токены и людей на ваших цифрах и скажем честно, что дешевле. Бесплатно, 30 минут.

Telegram

@mmoozzggru

Ответим в течение рабочего дня. Все контакты

Написать в Telegram