Глоссарий

Глоссарий: термины локального ИИ простыми словами

Михаил Мозг3 минуты чтения

Термины локального ИИ, которые встречаются на страницах раздела, с коротким объяснением и числом для ориентира там, где оно есть. Порядок от модели к железу и закону.

Модель

Токен: единица текста для модели, кусок слова; по данным Сбера, у GigaChat в среднем 3–4 символа на токен, документ на 10 страниц по 1 800 знаков около 4 500–6 000 токенов. Параметры: числа внутри модели, их количество пишут как 8B или 70B, миллиарды; чем больше, тем умнее и тяжелее. Активные параметры: в моделях с разреженной архитектурой на каждый токен работает часть параметров, например 3 млрд из 35, отсюда скорость 70 токенов в секунду на Mac. Контекст: сколько токенов модель видит разом; чем он длиннее, тем больше памяти под кэш, например агент VK Tech работал с контекстом 65 536 токенов. Открытые веса: файлы модели опубликованы, ее можно скачать и запустить у себя; лицензия Apache 2.0 разрешает коммерческое использование. Дообучение: обучение открытой модели на своих данных, нужны GPU и время; ИТ-холдинг больше года обучал модель на договорах. RAG, поиск по документам: модель отвечает по найденным фрагментам ваших документов без дообучения. Режим рассуждений: модель пишет промежуточные шаги перед ответом, точнее и дороже по токенам.

Память и скорость

Квантизация: сжатие весов с 16 бит до 8 или 4, память падает в 2–3,6 раза по коэффициентам нашего калькулятора, качество проверяйте на своих запросах; 70 млрд в 4 битах около 40 ГБ. FP16: формат весов в 16 бит, 2 байта на параметр. KV-кэш: память под контекст, 0,13–0,33 МБ на токен по правилу нашего калькулятора в зависимости от размера модели, умножается на число пользователей. Единая память: у Apple Silicon процессор и графика делят одну память до 512 ГБ, поэтому Mac вмещает модели, которые не помещаются в видеокарту. Видеопамять, VRAM: память на видеокарте, 24–96 ГБ; модель должна поместиться целиком. Токены в секунду: скорость генерации; один поток на модели 8B в 4 битах дает от 50,7 у M4 Pro до 144,5 у H100 по опубликованным замерам. Обработка запроса: чтение контекста до первого токена, у M5 Max 3 220 токенов в секунду на модели 7B в 4 битах по таблице llama.cpp. Выгрузка слоев: часть модели в оперативной памяти, когда не хватает видеопамяти; скорость заметно падает.

Железо и запуск

Движок выдачи, инференс: программа, которая запускает модель: llama.cpp, LM Studio, Ollama, vLLM. Пакетная выдача: обработка десятков запросов одновременно на серверной карте, суммарная скорость выше, чем у одного потока. Серверная карта: A100, H100, RTX PRO 6000 с 40–96 ГБ и коррекцией ошибок памяти, для дата-центра. Игровая карта: RTX 4090, RTX 5090 с 24–32 ГБ, для рабочей станции. Юнит, размещение: место в стойке дата-центра, от 7 500 ₽ в месяц с 300 Вт. Единый интерфейс модели: способ подключить агентов так, чтобы модель менялась настройкой. MCP: протокол, по которому агент подключает инструменты: базы, API, документы; оператор связи требует его в тендере. Маршрутизатор: компонент гибридной схемы, который решает, куда уйдет запрос: локально или в облако.

Закон

Суверенная модель: по 243-ФЗ с 1 марта 2027 года модель, которую российское юрлицо разрабатывает и полностью воспроизводит, включая обучение, с ответами и хранением данных в российских ЦОД. Национальная модель: допускает открытые иностранные компоненты при серверах и данных в России. Закрытый контур: сеть без выхода в интернет, где живут модель и данные. Локальное развертывание, on-premise: модель на ваших серверах, сеть может быть открытой. Договор поручения: документ по 152-ФЗ, по которому провайдер обрабатывает персональные данные за вас; у большинства зарубежных поставщиков его нет. Обезличивание: замена имен и номеров метками перед отправкой в облако; по 152-ФЗ после него без дополнительной информации нельзя определить, чьи это данные; если связь метки с человеком легко восстановить, данные могут остаться персональными.

Источники и даты

Михаил Мозг

Михаил Мозг

Основатель MMOOZZGG, ИИ-директор

Подробнее о Михаиле@mmoozzggru

Цены и замеры в разделе проверены 29.09.2026 по источникам внизу страниц. Мы собираем ИИ-агентов на облачных и локальных моделях и не продаем железо. Расчеты оценочные, юридические выводы по 152-ФЗ и 243-ФЗ дает ваш юрист.

Контакты

Разберем, где вашей компании нужен локальный ИИ, а где хватит облака

Посчитаем железо, токены и людей на ваших цифрах и скажем честно, что дешевле. Бесплатно, 30 минут.

Telegram

@mmoozzggru

Ответим в течение рабочего дня. Все контакты

Написать в Telegram