нейросетевой поиск по каталогу на локальной модели Qwen и арендованных GPU
Ритейл и производство
2 сентября 2026 · источник: platforms.su
Читать кейсОсновы
Михаил Мозг2 минуты чтения
Локальный ИИ стоит на открытых языковых моделях, то есть на моделях с открытыми весами. Ниже те, что имеют смысл для русскоязычного бизнеса, с размерами, лицензиями и датами выхода, и правило выбора по задаче и памяти.
T-Pro 2.0: 32 млрд параметров, лицензия Apache 2.0, гибридный режим рассуждений, выложена 18 июля 2025 года; разработчик заявляет более высокое качество на сложных русскоязычных запросах при вдвое меньших вычислениях по сравнению с открытыми конкурентами. YandexGPT 5 Lite: 8 млрд параметров, контекст 32 000 токенов, открытые веса с 25 февраля 2025 года, разработчик отмечает, что модель не требует больших мощностей. Крупный банк держит собственное семейство моделей Gen-T в своем периметре; по данным кейса, в него входят T-Pro и T-Lite с открытой лицензией Apache 2.0.
Семейство Qwen используется российскими компаниями в локальных контурах: производитель косметики поставил Qwen для поиска по каталогу, ИТ-руководитель банка гоняет агента на Qwen 3.6-35B-A3B со скоростью около 70 токенов в секунду на Mac, ИТ-подразделение сети магазинов сравнило локальную Qwen3.5-9B с облачными. Открытая модель gpt-oss 20b занимает 13 ГБ и работает вместе с моделью зрения на карте с 24 ГБ. Швейцарская Apertus выложена в размерах 8 и 70 млрд параметров с полностью открытыми весами, данными и рецептом обучения, лицензия допускает коммерческое применение.
Сначала память: модель на 8 млрд параметров в 4-битной квантизации занимает около 5 ГБ, на 32 млрд около 20 ГБ, на 70 млрд около 40 ГБ. Затем задача: по нашей оценке, для извлечения данных из документов и коротких цепочек хватает 8–32 млрд, для длинных рассуждений нужны крупные модели или облако. Затем язык: проверяйте модель на своих 50 запросах, а не на бенчмарках. Затем лицензия: Apache 2.0 и аналоги допускают коммерческое использование без отчислений.
Квантизация сжимает веса с 16 бит до 8 или 4 бит: память падает в 2–4 раза, потери качества зависят от модели и задачи. Локальная модель в тесте сети магазинов работала в 4-битной квантизации на одной видеокарте и на коротких задачах не уступила облачным. Для агентов мы берем 4–8 бит и проверяем на своих данных.

Ритейл и производство
2 сентября 2026 · источник: platforms.su
Читать кейсРитейл и производство
2 сентября 2026 · источник: platforms.su
Читать кейсБанки и финансы
источник: platforms.su
Читать кейсБанки и финансы
2 сентября 2026 · источник: platforms.su
Читать кейсБанки и финансы
2 сентября 2026 · источник: platforms.su
Читать кейсЦены и замеры в разделе проверены 29.09.2026 по источникам внизу страниц. Мы собираем ИИ-агентов на облачных и локальных моделях и не продаем железо. Расчеты оценочные, юридические выводы по 152-ФЗ и 243-ФЗ дает ваш юрист.
Контакты
Посчитаем железо, токены и людей на ваших цифрах и скажем честно, что дешевле. Бесплатно, 30 минут.