Разговор о локальных LLM часто начинается с железа: сколько нужно памяти, какая видеокарта подойдёт и какую квантизацию выбрать. Для бизнеса это второй вопрос. Первый — какой процесс мы улучшаем и что считается успешным результатом. Одна и та же модель может быть выгодной для классификации обращений и бесполезной для подготовки юридически значимого ответа.
Удобно разделить выбор на четыре оси: чувствительность данных, допустимая задержка, профиль нагрузки и способность команды эксплуатировать сервис. Если хотя бы одна ось не определена, сравнение моделей превращается в демонстрацию характеристик без бизнес-решения.
Данные: локально не значит автоматически безопасно
Локальная модель уменьшает число внешних передач, но не отменяет контроль доступа, журналирование, резервные копии и защиту рабочего места. Документ может остаться внутри сети и всё равно попасть в общий лог, кеш, векторное хранилище или резервную копию с неправильными правами. Сначала нарисуйте полный путь данных: от загрузки до удаления.
Для облака задайте те же вопросы: где обрабатывается запрос, сохраняются ли входы, можно ли отключить обучение на данных, как устроены сроки хранения и договорные гарантии. Сравнивайте не рекламные слова «private» и «enterprise», а конкретный поток и ответственность каждой стороны.
Задержка, контекст и реальная нагрузка
Локальная модель полезна для коротких частых операций рядом с данными: классификации, извлечения полей, черновиков и внутреннего поиска. Для редких пиковых запросов облако часто рациональнее: не нужно держать простаивающий ускоритель и самостоятельно масштабировать очередь.
Контекст особенно дорог для агентов и задач по коду. Ollama прямо связывает увеличение окна контекста с ростом потребления памяти. Поэтому тест «модель ответила на один вопрос» ничего не говорит о процессе, где нужно прочитать десятки документов, вызвать инструменты и обслужить несколько пользователей одновременно.
Железо и квантизация без культа характеристик
llama.cpp позволяет запускать квантизованные модели на разных CPU и GPU, включая смешанное размещение между памятью процессора и видеокарты. Это делает пилот доступным, но не гарантирует нужное качество. Более сильное сжатие экономит память ценой возможной потери точности, особенно в сложных инструкциях и структурированном выводе.
Проверьте три размера модели на своём наборе задач. Маленькая модель может уверенно закрыть маршрутизацию писем, средняя — извлечение и суммаризацию, а сложные исключения останутся облачной модели или человеку. Гибридная архитектура часто дешевле попытки заставить одну систему делать всё.
Стоимость успешной операции
Для локального варианта в стоимость входят железо или аренда, электричество, резервирование, обновления, мониторинг, время инженера и цена простоя. Для облака — токены, сетевые задержки, лимиты, хранение, корпоративные функции и стоимость смены поставщика. Общая единица сравнения — не запрос, а операция, которую бизнес принял без ручной переделки.
- Доля ответов, принятых без исправлений.
- Среднее и 95-й перцентиль времени до результата.
- Стоимость повторных попыток и ручной проверки.
- Число инцидентов доступа, отказов и нарушений формата.
- Время команды на поддержку за неделю.
Пилот, который можно закончить
Выберите один процесс с понятным владельцем и 50–100 обезличенными примерами. Зафиксируйте эталон, критерии качества и бюджет ошибки. Сравните локальную, облачную и гибридную схемы на одинаковых данных. Пилот длится две недели и заканчивается решением: внедрить, изменить задачу или отказаться.
Локальная LLM — не идеология, а вариант размещения. Она оправдана, когда ограничения данных и профиль нагрузки превращаются в измеримое преимущество. Если команда не готова поддерживать сервис или качество на реальных исключениях ниже порога, облако или гибрид будут более управляемым выбором.
Пример расчёта без самообмана
Представим службу, которая классифицирует 40 тысяч обращений в месяц. Облачная модель обходится в 90 тысяч рублей вместе с повторными запросами, а локальный сервер — в 420 тысяч разово и ещё 70 тысяч ежемесячно на эксплуатацию и часть времени инженера. Сравнить 90 и 70 тысяч недостаточно: у локальной модели 82% ответов проходят без правки, у облачной — 94%, а ручная обработка исключения стоит 25 рублей. Разница качества добавит локальному варианту около 120 тысяч рублей ручного труда. В таком виде «свои токены дешевле» перестают быть аргументом.
Затем проведите чувствительный расчёт. Что будет, если объём удвоится, тариф облака снизится, понадобится резервный сервер или новый формат обращений ухудшит качество? Отдельно задайте стоимость часа недоступности и срок, за который команда обязана установить обновление безопасности. Это переводит разговор с характеристик видеокарты на обязательства сервиса.
Матрица размещения по данным и задаче
- Публичные тексты и нерегулярная нагрузка: облако обычно быстрее для старта.
- Внутренние документы с разрешённой передачей поставщику: облако с корпоративными условиями или гибрид.
- Регулируемые данные без допустимого внешнего контура: локальное размещение после проверки всей цепочки.
- Массовая узкая классификация: маленькая локальная модель, если качество подтверждено выборкой.
- Редкие сложные исключения: маршрутизация к более сильной облачной модели или человеку.
Гибрид не означает хаотичный выбор модели для каждого запроса. Правила маршрутизации должны быть детерминированы: тип данных, класс задачи, допустимая задержка и порог уверенности. Логи хранят причину маршрута без лишнего содержимого запроса. Если локальная модель не соблюдает формат или оценка ниже порога, система не импровизирует, а использует заранее назначенный безопасный путь.