Глоссарий
Глоссарий: термины локального ИИ простыми словами
Михаил Мозг3 минуты чтения
Термины локального ИИ, которые встречаются на страницах раздела, с коротким объяснением и числом для ориентира там, где оно есть. Порядок от модели к железу и закону.
Модель
Токен: единица текста для модели, кусок слова; по данным Сбера, у GigaChat в среднем 3–4 символа на токен, документ на 10 страниц по 1 800 знаков около 4 500–6 000 токенов. Параметры: числа внутри модели, их количество пишут как 8B или 70B, миллиарды; чем больше, тем умнее и тяжелее. Активные параметры: в моделях с разреженной архитектурой на каждый токен работает часть параметров, например 3 млрд из 35, отсюда скорость 70 токенов в секунду на Mac. Контекст: сколько токенов модель видит разом; чем он длиннее, тем больше памяти под кэш, например агент VK Tech работал с контекстом 65 536 токенов. Открытые веса: файлы модели опубликованы, ее можно скачать и запустить у себя; лицензия Apache 2.0 разрешает коммерческое использование. Дообучение: обучение открытой модели на своих данных, нужны GPU и время; ИТ-холдинг больше года обучал модель на договорах. RAG, поиск по документам: модель отвечает по найденным фрагментам ваших документов без дообучения. Режим рассуждений: модель пишет промежуточные шаги перед ответом, точнее и дороже по токенам.
Память и скорость
Квантизация: сжатие весов с 16 бит до 8 или 4, память падает в 2–3,6 раза по коэффициентам нашего калькулятора, качество проверяйте на своих запросах; 70 млрд в 4 битах около 40 ГБ. FP16: формат весов в 16 бит, 2 байта на параметр. KV-кэш: память под контекст, 0,13–0,33 МБ на токен по правилу нашего калькулятора в зависимости от размера модели, умножается на число пользователей. Единая память: у Apple Silicon процессор и графика делят одну память до 512 ГБ, поэтому Mac вмещает модели, которые не помещаются в видеокарту. Видеопамять, VRAM: память на видеокарте, 24–96 ГБ; модель должна поместиться целиком. Токены в секунду: скорость генерации; один поток на модели 8B в 4 битах дает от 50,7 у M4 Pro до 144,5 у H100 по опубликованным замерам. Обработка запроса: чтение контекста до первого токена, у M5 Max 3 220 токенов в секунду на модели 7B в 4 битах по таблице llama.cpp. Выгрузка слоев: часть модели в оперативной памяти, когда не хватает видеопамяти; скорость заметно падает.
Железо и запуск
Движок выдачи, инференс: программа, которая запускает модель: llama.cpp, LM Studio, Ollama, vLLM. Пакетная выдача: обработка десятков запросов одновременно на серверной карте, суммарная скорость выше, чем у одного потока. Серверная карта: A100, H100, RTX PRO 6000 с 40–96 ГБ и коррекцией ошибок памяти, для дата-центра. Игровая карта: RTX 4090, RTX 5090 с 24–32 ГБ, для рабочей станции. Юнит, размещение: место в стойке дата-центра, от 7 500 ₽ в месяц с 300 Вт. Единый интерфейс модели: способ подключить агентов так, чтобы модель менялась настройкой. MCP: протокол, по которому агент подключает инструменты: базы, API, документы; оператор связи требует его в тендере. Маршрутизатор: компонент гибридной схемы, который решает, куда уйдет запрос: локально или в облако.
Закон
Суверенная модель: по 243-ФЗ с 1 марта 2027 года модель, которую российское юрлицо разрабатывает и полностью воспроизводит, включая обучение, с ответами и хранением данных в российских ЦОД. Национальная модель: допускает открытые иностранные компоненты при серверах и данных в России. Закрытый контур: сеть без выхода в интернет, где живут модель и данные. Локальное развертывание, on-premise: модель на ваших серверах, сеть может быть открытой. Договор поручения: документ по 152-ФЗ, по которому провайдер обрабатывает персональные данные за вас; у большинства зарубежных поставщиков его нет. Обезличивание: замена имен и номеров метками перед отправкой в облако; по 152-ФЗ после него без дополнительной информации нельзя определить, чьи это данные; если связь метки с человеком легко восстановить, данные могут остаться персональными.
Источники и даты
- llama.cpp, производительность на Apple Silicon, таблица обновлена 25.08.2026github.com
- GPU-Benchmarks-on-LLM-Inference, Llama 3 8B и 70B, май 2024github.com
- HOSTKEY, colocation в Москве, 2026hostkey.ru
- CNews, какие модели ИИ получат статус суверенных, 28.09.2026, материал с пометкой «реклама»corp.cnews.ru
- Anti-Malware, 152-ФЗ и нейросети, 17.06.2026anti-malware.ru
- iXBT, Т-Банк выпустил T-Pro 2.0 (32B, Apache 2.0), 18.07.2025ixbt.com
- Sber Developers, подсчет токенов GigaChat: в среднем 3–4 символа на токен, 17.07.2026developers.sber.ru
- Федеральный закон от 26.07.2026 № 243-ФЗ, текст на КонсультантПлюсconsultant.ru
- Федеральный закон № 152-ФЗ «О персональных данных», текст на КонсультантПлюсconsultant.ru
Что дальше
Вернуться в раздел
Цены и замеры в разделе проверены 29.09.2026 по источникам внизу страниц. Мы собираем ИИ-агентов на облачных и локальных моделях и не продаем железо. Расчеты оценочные, юридические выводы по 152-ФЗ и 243-ФЗ дает ваш юрист.
Контакты
Разберем, где вашей компании нужен локальный ИИ, а где хватит облака
Посчитаем железо, токены и людей на ваших цифрах и скажем честно, что дешевле. Бесплатно, 30 минут.