Сравнение

Сравнение Ollama, LM Studio, llama.cpp и vLLM: чем запускать локальную модель

Михаил Мозг2 минуты чтения

Модель это файл, а запускает его движок. От движка зависит скорость, число одновременных пользователей и то, подключится ли к нему ваш агент как к облаку. Ниже сравнение Ollama, LM Studio, llama.cpp и vLLM: для кого каждый движок и как они соотносятся с железом из этого раздела.

LM Studio: один человек, Mac или ноутбук

Программа с окном: выбрали модель из каталога, нажали скачать, начали чат. Показывает скорость в токенах в секунду после каждого ответа, поднимает локальный API, совместимый с привычными библиотеками. Подходит для проверки моделей перед покупкой железа и для персонального агента. Так работает персональный агент ИТ-руководителя банка на Mac.

Ollama: один-два человека, команда разработчиков

Командная строка и служба в фоне: одна команда ставит модель, вторая запускает API. Удобнее LM Studio для интеграций и скриптов, работает на Mac, Linux и Windows, на видеокартах и на Apple Silicon. Ограничение то же: одиночные запросы обрабатываются быстро, при многих одновременных часть ждет в очереди.

llama.cpp: основа и замеры

Библиотека, на которой построены LM Studio, Ollama и десятки других программ. Ее таблица замеров на Apple Silicon это источник цифр в этом разделе: M4 Max 83,1 токена в секунду, M5 Max 119,9 на модели Llama 2 7B в 4 битах. Используют напрямую, когда нужен полный контроль над параметрами и минимальные накладные расходы.

vLLM: сервер для отдела

Движок пакетной выдачи для видеокарт: обрабатывает десятки запросов одновременно, распределяя память кэша между ними, и, по нашей оценке, дает суммарную скорость в тысячи токенов в секунду на серверной карте. По нашей оценке, он превращает сервер с двумя картами по 96 ГБ в сервис для 10–20 пользователей, а четыре H100 в сервис на сотни. Рассчитан на Linux-серверы с видеокартами и требует инженера.

Как выбрать

Один пользователь на Mac или ноутбуке: LM Studio. Разработчик или интеграция на одном компьютере: Ollama. Отдел и агенты с очередью запросов на сервере с видеокартами: vLLM. Наши агенты подключаются к любому из них через единый интерфейс модели, поэтому переезд с облака на локальный движок и обратно это настройка, а не переписывание.

Вопросы и ответы

Нужен ли Linux для локальной модели?

Для одного пользователя нет: LM Studio и Ollama работают на macOS и Windows. Для сервера с vLLM да.

Можно ли запустить vLLM на Mac Studio?

Для работы отдела нет: vLLM рассчитан на серверы с видеокартами. На Mac для нескольких пользователей используют llama.cpp с сервером и параллельными слотами, скорость на поток при этом падает.

Источники и даты

Михаил Мозг

Михаил Мозг

Основатель MMOOZZGG, ИИ-директор

Подробнее о Михаиле@mmoozzggru

Кейсы по теме: 8

  • Кейс рынка · Россия

    Т-Банк собственные LLM решают 45% обращений, по оценке затраты на поддержку ниже минимум на 25% в год

    Банк встроил в чат-бот собственные языковые модели семейства Gen-T: около 45% обращений клиентов решаются без оператора. В октябре 2025 года запущены ИИ-копайлоты для операторов первой линии, ими ежедневно пользуются более 90% сотрудников поддержки. Модели развернуты в периметре банка, данные вовне не передаются.

    Банки и финансы

    источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Т-Технологии ИИ-ассистент для задач с деньгами на собственных моделях Gen-T, бета с 20 июля 2026

    Группа разработала ИИ-ассистента для задач, связанных с деньгами и покупками, на собственных больших языковых моделях семейства Gen-T. Чтобы избежать выдумок, система опирается на верифицированные источники данных, а не только на знания модели. Бета представлена 20 июля 2026 года, полноценный запуск запланирован на осень.

    Банки и финансы

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Альфа-Банк, ИТ-руководитель локальный агент на модели Qwen 3.6-35B-A3B: около 70 токенов в секунду на Mac

    Автономный рабочий агент работает на локально развернутой модели с 35 млрд параметров и примерно 3 млрд активных на токен через LM Studio, скорость около 70 токенов в секунду на Mac. Сначала агент запускался в Docker на Mac, затем переехал на виртуальную машину, что стало переломным моментом по удобству.

    Банки и финансы

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    ИТ-холдинг Т1 согласование договоров за 3 дня вместо двух недель, затраты на сравнение документов ниже на 40%

    Юридический департамент холдинга, более 70 юристов, больше года обучал собственную языковую модель на юридических данных компании. Согласование договоров сократилось с двух недель до трех дней, сравнение двух версий документа выполняется в пять раз быстрее, чем вручную.

    ИТ-компании

    источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    НСИС, оператор АИС страхования обработка обращений в 20 раз быстрее на локальной LLM, рост обращений в 1,5 раза без найма

    Оператор национальной страховой информационной системы развернул большую языковую модель локально и построил на ней три контура: автоматическую обработку обращений с множественными полями, RAG-сервис технической поддержки на документах компании и ИИ-агентов в процессе разработки, включая автоматический код-ревью.

    ИТ-компании

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    Digital Sector и заказчик из ИТ-инфраструктуры ИИ-агент анализа договоров в закрытом контуре заказчика; во внутреннем тестировании интегратора агенты высвободили 20% времени команды

    Интегратор реализовал ИИ-агента для первичного анализа договоров в закрытом контуре заказчика, который проектирует и поставляет ИТ-инфраструктуру: агент извлекает и сопоставляет данные, выявляет расхождения и готовит результат для специалиста. Агентов интегратор внедрил и в собственные процессы тестирования: высвобождено 20% рабочего времени команды за спринт.

    ИТ-компании

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    VK Tech две модели уместились в 22,4 ГБ из 24 ГБ видеопамяти при контексте 65 536 токенов

    Команда собрала локального ИИ-агента в закрытом контуре на связке Ollama и агентной обвязки на арендованном GPU-сервере с картой NVIDIA A30 на 24 ГБ. Модели: gpt-oss 20b (13 ГБ) для текста и инструментов и qwen3-vl 8b (6,1 ГБ) для изображений; вместе с KV-кэшем на контекст 65 536 токенов занято 22,4 ГБ.

    ИТ-компании

    2 сентября 2026 · источник: platforms.su

    Читать кейс
  • Кейс рынка · Россия

    ЛАНИТ сбор требований в 4 раза быстрее, время поиска документов на 66% меньше на платформе локальных LLM

    Группа разработала платформу для локального развертывания больших языковых моделей на инфраструктуре заказчика: чат и сложные конвейеры обработки документов, аудио и изображений. Дочерняя компания создала собственную модель, дообученную на русскоязычных данных, и пилотирует ее в CRM-, SRM- и HRM-проектах и корпоративных чат-ботах.

    ИТ-компании

    источник: platforms.su

    Читать кейс
Все кейсы: 18

Цены и замеры в разделе проверены 29.09.2026 по источникам внизу страниц. Мы собираем ИИ-агентов на облачных и локальных моделях и не продаем железо. Расчеты оценочные, юридические выводы по 152-ФЗ и 243-ФЗ дает ваш юрист.

Контакты

Разберем, где вашей компании нужен локальный ИИ, а где хватит облака

Посчитаем железо, токены и людей на ваших цифрах и скажем честно, что дешевле. Бесплатно, 30 минут.

Telegram

@mmoozzggru

Ответим в течение рабочего дня. Все контакты

Написать в Telegram