Кейс · Банки и финансы · Россия

Альфа-Банк, ИТ-руководитель: локальный агент на модели Qwen 3.6-35B-A3B: около 70 токенов в секунду на Mac

Автономный рабочий агент работает на локально развернутой модели с 35 млрд параметров и примерно 3 млрд активных на токен через LM Studio, скорость около 70 токенов в секунду на Mac. Сначала агент запускался в Docker на Mac, затем переехал на виртуальную машину, что стало переломным моментом по удобству.

Результат
локальный агент на модели Qwen 3.6-35B-A3B: около 70 токенов в секунду на Mac
Источник
Цифровые платформы, кейс №40672 сентября 2026

Что сделали и что получили

  • Детерминированная обработка данных вынесена в отдельные приложения на Go с интеграцией к базе и векторному поиску, агенту оставлены задачи потребления.
  • Источники: почта, транскрипты встреч, мессенджеры.
  • Это персональный агент руководителя, не корпоративное развертывание; числовых результатов не раскрыто.
  • Публикация 21 августа 2026 года.

Что взять себе

Модель с малым числом активных параметров дает около 70 токенов в секунду на Mac. Для агента этого достаточно, если тяжелая обработка вынесена в код.

ИИ-агенты на локальной модели в вашем контуре: пилот на одном процессе

Пилотный ИИ-агент на локальной модели за 14 дней от 150 000 ₽ с метрикой в договоре, на вашем железе или арендованных GPU в России. ИИ-отдел из 3–5 агентов за 4–6 недель от 450 000 ₽. Железо покупаете вы по нашей спецификации.

Источник

Числа принадлежат организации из источника и приведены без пересчета: Цифровые платформы, кейс №4067, 2 сентября 2026. Тип данных: карточка каталога проектов. Числа сверены с источником 30 сентября 2026. Организация из кейса не наш клиент, результат не обещание для вашей компании.

Похожие кейсы

  • Кейс рынка · Россия

    Т-Банк собственные LLM решают 45% обращений, по оценке затраты на поддержку ниже минимум на 25% в год

    Банк встроил в чат-бот собственные языковые модели семейства Gen-T: около 45% обращений клиентов решаются без оператора. В октябре 2025 года запущены ИИ-копайлоты для операторов первой линии, ими ежедневно пользуются более 90% сотрудников поддержки. Модели развернуты в периметре банка, данные вовне не передаются.

    Банки и финансы

    источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Т-Технологии ИИ-ассистент для задач с деньгами на собственных моделях Gen-T, бета с 20 июля 2026

    Группа разработала ИИ-ассистента для задач, связанных с деньгами и покупками, на собственных больших языковых моделях семейства Gen-T. Чтобы избежать выдумок, система опирается на верифицированные источники данных, а не только на знания модели. Бета представлена 20 июля 2026 года, полноценный запуск запланирован на осень.

    Банки и финансы

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    VK Tech две модели уместились в 22,4 ГБ из 24 ГБ видеопамяти при контексте 65 536 токенов

    Команда собрала локального ИИ-агента в закрытом контуре на связке Ollama и агентной обвязки на арендованном GPU-сервере с картой NVIDIA A30 на 24 ГБ. Модели: gpt-oss 20b (13 ГБ) для текста и инструментов и qwen3-vl 8b (6,1 ГБ) для изображений; вместе с KV-кэшем на контекст 65 536 токенов занято 22,4 ГБ.

    ИТ-компании

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Петрович-Тех локальная модель на 9 млрд параметров сравнялась с облачными на задачах из 2–3 шагов: 27 прогонов

    ИТ-подразделение сети строительных магазинов сравнило три модели в единой агентной обвязке с 13 виджетами аналитической панели и около 30 инструментами: облачную западную модель, облачную открытую модель на 235 млрд параметров и локальную модель на 9 млрд параметров в 4-битной квантизации на одной видеокарте. Схема: 3 сценария, 3 модели, 3 прогона, 27 запусков.

    Ритейл и производство

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    ЛАНИТ сбор требований в 4 раза быстрее, время поиска документов на 66% меньше на платформе локальных LLM

    Группа разработала платформу для локального развертывания больших языковых моделей на инфраструктуре заказчика: чат и сложные конвейеры обработки документов, аудио и изображений. Дочерняя компания создала собственную модель, дообученную на русскоязычных данных, и пилотирует ее в CRM-, SRM- и HRM-проектах и корпоративных чат-ботах.

    ИТ-компании

    источник: platforms.su

    Читать кейс

Пилот со скидкой для 3 компаний

Пилот за 50 000 ₽ вместо 150 000 ₽. Взамен публикуем разбор проекта с цифрами. Мест свободно: 2 из 3.

Занять место

Цены и замеры в разделе проверены 29.09.2026 по источникам внизу страниц. Мы собираем ИИ-агентов на облачных и локальных моделях и не продаем железо. Расчеты оценочные, юридические выводы по 152-ФЗ и 243-ФЗ дает ваш юрист.

Контакты

Посчитаем локальный ИИ под вашу задачу за 30 минут

Скажем, какая модель подойдет, на каком железе она заработает и когда выгоднее облако. Бесплатно.

Telegram

@mmoozzggru

Ответим в течение рабочего дня. Все контакты

Написать в Telegram