Основы

Открытые языковые модели для локального запуска: что есть и что выбрать

Михаил Мозг2 минуты чтения

Локальный ИИ стоит на открытых языковых моделях, то есть на моделях с открытыми весами. Ниже те, что имеют смысл для русскоязычного бизнеса, с размерами, лицензиями и датами выхода, и правило выбора по задаче и памяти.

Российские открытые модели

T-Pro 2.0: 32 млрд параметров, лицензия Apache 2.0, гибридный режим рассуждений, выложена 18 июля 2025 года; разработчик заявляет более высокое качество на сложных русскоязычных запросах при вдвое меньших вычислениях по сравнению с открытыми конкурентами. YandexGPT 5 Lite: 8 млрд параметров, контекст 32 000 токенов, открытые веса с 25 февраля 2025 года, разработчик отмечает, что модель не требует больших мощностей. Крупный банк держит собственное семейство моделей Gen-T в своем периметре; по данным кейса, в него входят T-Pro и T-Lite с открытой лицензией Apache 2.0.

Мировые открытые модели

Семейство Qwen используется российскими компаниями в локальных контурах: производитель косметики поставил Qwen для поиска по каталогу, ИТ-руководитель банка гоняет агента на Qwen 3.6-35B-A3B со скоростью около 70 токенов в секунду на Mac, ИТ-подразделение сети магазинов сравнило локальную Qwen3.5-9B с облачными. Открытая модель gpt-oss 20b занимает 13 ГБ и работает вместе с моделью зрения на карте с 24 ГБ. Швейцарская Apertus выложена в размерах 8 и 70 млрд параметров с полностью открытыми весами, данными и рецептом обучения, лицензия допускает коммерческое применение.

Как выбирать

Сначала память: модель на 8 млрд параметров в 4-битной квантизации занимает около 5 ГБ, на 32 млрд около 20 ГБ, на 70 млрд около 40 ГБ. Затем задача: по нашей оценке, для извлечения данных из документов и коротких цепочек хватает 8–32 млрд, для длинных рассуждений нужны крупные модели или облако. Затем язык: проверяйте модель на своих 50 запросах, а не на бенчмарках. Затем лицензия: Apache 2.0 и аналоги допускают коммерческое использование без отчислений.

Квантизация

Квантизация сжимает веса с 16 бит до 8 или 4 бит: память падает в 2–4 раза, потери качества зависят от модели и задачи. Локальная модель в тесте сети магазинов работала в 4-битной квантизации на одной видеокарте и на коротких задачах не уступила облачным. Для агентов мы берем 4–8 бит и проверяем на своих данных.

Вопросы и ответы

Понимают ли зарубежные открытые модели русский язык?

Крупные семейства понимают, но качество на русском у разных моделей разное. Проверяйте на своих запросах: 50 реальных диалогов покажут больше, чем таблица бенчмарков.

Можно ли дообучить открытую модель на своих данных?

Да, ИТ-холдинг больше года дообучал модель на своих договорах. Для большинства задач достаточно поиска по документам (RAG) без дообучения.

Источники и даты

Михаил Мозг

Михаил Мозг

Основатель MMOOZZGG, ИИ-директор

Подробнее о Михаиле@mmoozzggru

Кейсы по теме: 5

  • Кейс рынка · Россия

    Фаберлик нейросетевой поиск по каталогу на локальной модели Qwen и арендованных GPU

    Производитель косметики заменил классический поиск по каталогу нейросетевым: локальная языковая модель Qwen и векторный семантический поиск развернуты на GPU-инфраструктуре российского облака. Модель работает внутри контролируемой инфраструктуры, данные не передаются во внешние сервисы, затраты на обработку запросов под контролем.

    Ритейл и производство

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Петрович-Тех локальная модель на 9 млрд параметров сравнялась с облачными на задачах из 2–3 шагов: 27 прогонов

    ИТ-подразделение сети строительных магазинов сравнило три модели в единой агентной обвязке с 13 виджетами аналитической панели и около 30 инструментами: облачную западную модель, облачную открытую модель на 235 млрд параметров и локальную модель на 9 млрд параметров в 4-битной квантизации на одной видеокарте. Схема: 3 сценария, 3 модели, 3 прогона, 27 запусков.

    Ритейл и производство

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Т-Банк собственные LLM решают 45% обращений, по оценке затраты на поддержку ниже минимум на 25% в год

    Банк встроил в чат-бот собственные языковые модели семейства Gen-T: около 45% обращений клиентов решаются без оператора. В октябре 2025 года запущены ИИ-копайлоты для операторов первой линии, ими ежедневно пользуются более 90% сотрудников поддержки. Модели развернуты в периметре банка, данные вовне не передаются.

    Банки и финансы

    источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Т-Технологии ИИ-ассистент для задач с деньгами на собственных моделях Gen-T, бета с 20 июля 2026

    Группа разработала ИИ-ассистента для задач, связанных с деньгами и покупками, на собственных больших языковых моделях семейства Gen-T. Чтобы избежать выдумок, система опирается на верифицированные источники данных, а не только на знания модели. Бета представлена 20 июля 2026 года, полноценный запуск запланирован на осень.

    Банки и финансы

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Альфа-Банк, ИТ-руководитель локальный агент на модели Qwen 3.6-35B-A3B: около 70 токенов в секунду на Mac

    Автономный рабочий агент работает на локально развернутой модели с 35 млрд параметров и примерно 3 млрд активных на токен через LM Studio, скорость около 70 токенов в секунду на Mac. Сначала агент запускался в Docker на Mac, затем переехал на виртуальную машину, что стало переломным моментом по удобству.

    Банки и финансы

    2 сентября 2026 · источник: platforms.su

    Читать кейс
Все кейсы: 18

Цены и замеры в разделе проверены 29.09.2026 по источникам внизу страниц. Мы собираем ИИ-агентов на облачных и локальных моделях и не продаем железо. Расчеты оценочные, юридические выводы по 152-ФЗ и 243-ФЗ дает ваш юрист.

Контакты

Разберем, где вашей компании нужен локальный ИИ, а где хватит облака

Посчитаем железо, токены и людей на ваших цифрах и скажем честно, что дешевле. Бесплатно, 30 минут.

Telegram

@mmoozzggru

Ответим в течение рабочего дня. Все контакты

Написать в Telegram