Калькулятор

Калькулятор памяти: поместится ли модель в ваш компьютер

Михаил Мозг3 минуты чтения

Модель, которая не поместилась в память, не работает вообще. Калькулятор памяти для LLM, больших языковых моделей, считает три слагаемых: веса, кэш контекста и запас, и сравнивает итог с памятью ноутбука, Mac Studio, видеокарт и серверных карт. Формула и примеры под калькулятором, чтобы вы могли пересчитать вручную.

Калькулятор

Поместится ли модель в память

Сколько памяти нужно

  • Веса17,6 ГБ
  • KV-кэш (0,25 МБ на токен)2 ГБ
  • Другие модели0 ГБ
  • Итого с запасом 15%22,5 ГБ

Модели с малым числом активных параметров считайте по полному числу параметров. Точная память на токен смотрится в карточке модели.

На каком железе запустится

  • MacBook Pro, 48 ГБда, 40 ГБ
  • MacBook Pro, 64 ГБда, 56 ГБ
  • MacBook Pro 14 M5 Max, 128 ГБ, 2 ТБ, 671 594 ₽да, 120 ГБ
  • Mac Studio M3 Ultra, 96 ГБ, 650 797 ₽да, 88 ГБ
  • Mac Studio M4 Max, 128 ГБ, 886 757 ₽да, 120 ГБ
  • Mac Studio M3 Ultra, 512 ГБ, 4 ТБ, 3 155 392 ₽да, 504 ГБ
  • RTX 4090, 24 ГБ, 488 150 ₽впритык, 24 ГБ
  • RTX 5090, 32 ГБ, 749 990 ₽да, 32 ГБ
  • 2 x RTX 5090, 64 ГБ, 1 499 980 ₽да, 64 ГБ
  • RTX PRO 6000, 96 ГБ, 1 080 000 ₽да, 96 ГБ
  • 2 x RTX PRO 6000, 192 ГБ, 2 160 000 ₽да, 192 ГБ
  • A100, 40 ГБ, 543 577 ₽да, 40 ГБ
  • A100, 80 ГБ, 1 081 772 ₽да, 80 ГБ
  • H100 SXM5, 80 ГБ, 2 287 329 ₽да, 80 ГБ
  • 4 x H100, 320 ГБ, 9 149 316 ₽да, 320 ГБ

Для Mac учтена единая память минус 8 ГБ на систему. «Впритык» значит запас меньше 10%.

Значения по умолчанию из источников на 29.09.2026; курс ЦБ 84,41 ₽ за доллар. Расчет оценочный, любое поле можно изменить.

Как считает калькулятор

Веса: число параметров в миллиардах, умноженное на байты на параметр: 2 в FP16, 1 в 8-битной квантизации, 0,55 в 4-битной с учетом служебных данных формата. KV-кэш: длина контекста в токенах, умноженная на память на токен, которая зависит от архитектуры: около 0,13 МБ для моделей на 8 млрд параметров, 0,25 МБ для 30 млрд, 0,33 МБ для 70 млрд и выше. Запас: 15% на рабочие буферы и систему, поле можно изменить. Для нескольких одновременных пользователей кэш умножается на их число.

Примеры расчета

Модель 8 млрд, 4 бита, контекст 8 192 токена: веса 4,4 ГБ, кэш 1,0 ГБ, с запасом 6,3 ГБ: ноутбук с 16 ГБ. Та же модель с контекстом 32 768: 9,8 ГБ. Модель 32 млрд, 4 бита, 8 192 токена: 22,5 ГБ: видеокарта на 24 ГБ впритык, на 32 ГБ с запасом, Mac с 36 ГБ. Модель 70 млрд, 4 бита: 47,3 ГБ, с контекстом 32 768 уже 56,4 ГБ: Mac с 64 ГБ подходит для контекста 8 192 и не вмещает 32 768, Mac со 128 ГБ с запасом, две карты по 32 ГБ или одна на 96 ГБ. Модель 70 млрд в FP16: 164 ГБ, две серверные карты по 80 ГБ с выгрузкой части слоев, две карты по 96 ГБ или Mac Studio с 512 ГБ. Модель 671 млрд, 4 бита: 427 ГБ: только Mac Studio с 512 ГБ, где она реально работает на 6,21 токена в секунду, или сервер с шестью картами по 80 ГБ.

С чем сравнивает

Список железа в калькуляторе: MacBook Pro с 36, 64 и 128 ГБ; Mac Studio с 96, 128 и 512 ГБ; RTX 4090 с 24 ГБ; RTX 5090 с 32 ГБ и пара таких карт; RTX PRO 6000 с 96 ГБ и пара таких карт; A100 с 40 и 80 ГБ; H100 с 80 ГБ и сервер с четырьмя H100. Для Mac считается единая память за вычетом 8 ГБ на систему, для видеокарт полный объем видеопамяти. Цены железа на 29.09.2026 подставляются из нашей базы, у MacBook Pro на 36 и 64 ГБ цены нет; источники цен указаны на страницах о железе.

Проверка на реальном кейсе

Команда облачного провайдера уместила на карте с 24 ГБ текстовую модель и модель зрения при контексте 65 536 токенов: веса 13,0 и 6,1 ГБ, кэш 0,9 и 2,4 ГБ, итого 22,4 ГБ. Если внести те же слагаемые и убрать запас, калькулятор покажет 22,4 ГБ и отметит карту на 24 ГБ как «впритык», то есть с запасом меньше 10%; со стандартным запасом 15% итог 25,8 ГБ, и карта на 24 ГБ не проходит.

Границы расчета

Модели с малым числом активных параметров, например 30 млрд всего и 3 млрд активных, занимают память по полному числу параметров, а по скорости ведут себя как маленькие: считайте по полному размеру. Память на токен сильно зависит от архитектуры, точное значение смотрите в карточке модели. Калькулятор не учитывает модели зрения и речи, которые загружаются рядом: добавьте их веса отдельной строкой.

Вопросы и ответы

Что делать, если не хватает 2–3 ГБ?

Уменьшить контекст, взять квантизацию ниже или модель на ступень меньше. Выгрузка части слоев в оперативную память работает, но скорость падает в разы.

Почему у Mac считается память минус 8 ГБ?

Единая память делится с системой и программами. Сколько памяти реально доступно под модель на вашем Mac, проверьте пробной загрузкой модели в LM Studio; 8 ГБ это запас калькулятора по умолчанию.

Источники и даты

Михаил Мозг

Михаил Мозг

Основатель MMOOZZGG, ИИ-директор

Подробнее о Михаиле@mmoozzggru

Кейсы по теме: 5

  • Кейс рынка · Россия

    ИТ-холдинг Т1 согласование договоров за 3 дня вместо двух недель, затраты на сравнение документов ниже на 40%

    Юридический департамент холдинга, более 70 юристов, больше года обучал собственную языковую модель на юридических данных компании. Согласование договоров сократилось с двух недель до трех дней, сравнение двух версий документа выполняется в пять раз быстрее, чем вручную.

    ИТ-компании

    источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    НСИС, оператор АИС страхования обработка обращений в 20 раз быстрее на локальной LLM, рост обращений в 1,5 раза без найма

    Оператор национальной страховой информационной системы развернул большую языковую модель локально и построил на ней три контура: автоматическую обработку обращений с множественными полями, RAG-сервис технической поддержки на документах компании и ИИ-агентов в процессе разработки, включая автоматический код-ревью.

    ИТ-компании

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Digital Sector и заказчик из ИТ-инфраструктуры ИИ-агент анализа договоров в закрытом контуре заказчика; во внутреннем тестировании интегратора агенты высвободили 20% времени команды

    Интегратор реализовал ИИ-агента для первичного анализа договоров в закрытом контуре заказчика, который проектирует и поставляет ИТ-инфраструктуру: агент извлекает и сопоставляет данные, выявляет расхождения и готовит результат для специалиста. Агентов интегратор внедрил и в собственные процессы тестирования: высвобождено 20% рабочего времени команды за спринт.

    ИТ-компании

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    VK Tech две модели уместились в 22,4 ГБ из 24 ГБ видеопамяти при контексте 65 536 токенов

    Команда собрала локального ИИ-агента в закрытом контуре на связке Ollama и агентной обвязки на арендованном GPU-сервере с картой NVIDIA A30 на 24 ГБ. Модели: gpt-oss 20b (13 ГБ) для текста и инструментов и qwen3-vl 8b (6,1 ГБ) для изображений; вместе с KV-кэшем на контекст 65 536 токенов занято 22,4 ГБ.

    ИТ-компании

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    ЛАНИТ сбор требований в 4 раза быстрее, время поиска документов на 66% меньше на платформе локальных LLM

    Группа разработала платформу для локального развертывания больших языковых моделей на инфраструктуре заказчика: чат и сложные конвейеры обработки документов, аудио и изображений. Дочерняя компания создала собственную модель, дообученную на русскоязычных данных, и пилотирует ее в CRM-, SRM- и HRM-проектах и корпоративных чат-ботах.

    ИТ-компании

    источник: platforms.su

    Читать кейс
Все кейсы: 18

Цены и замеры в разделе проверены 29.09.2026 по источникам внизу страниц. Мы собираем ИИ-агентов на облачных и локальных моделях и не продаем железо. Расчеты оценочные, юридические выводы по 152-ФЗ и 243-ФЗ дает ваш юрист.

Контакты

Разберем, где вашей компании нужен локальный ИИ, а где хватит облака

Посчитаем железо, токены и людей на ваших цифрах и скажем честно, что дешевле. Бесплатно, 30 минут.

Telegram

@mmoozzggru

Ответим в течение рабочего дня. Все контакты

Написать в Telegram