AI · 8 мин чтения

Нейросети для бизнеса, которые можно скачать и держать у себя

За последний год ко мне стало чаще приходить одно и то же: клиенты хотят нейросети для бизнеса скачать и держать на своём сервере, а не платить каждый месяц за облачный API и не отправлять переписку с клиентами на серверы за рубежом. Причины разные: у кого-то персональные данные клиентов, у кого-то просто надоело зависеть от курса доллара в счетах за токены. Расскажу, что реально можно скачать, сколько это стоит по железу и куда такие проекты упираются на практике.

Зачем скачивать нейросеть, а не подключать облачный API

Три причины, с которыми ко мне приходят чаще всего. Первая - персональные данные. Если бот работает с перепиской клиентов, историей болезни, финансовыми документами, хранить это на серверах OpenAI или Anthropic формально не запрещено, но по 152-ФЗ персональные данные россиян обязаны обрабатываться на серверах в РФ. Локальная модель на своём сервере в Москве или Петербурге снимает этот вопрос сразу.

Вторая причина - предсказуемость расходов. Облачный API считает деньги по токенам, и при потоке в несколько тысяч запросов в день счёт может вырасти в разы за месяц без предупреждения. Сервер с видеокартой стоит фиксированную сумму независимо от нагрузки.

Третья - автономность. Если у компании внутренний инструмент вроде поиска по документам или помощника для сотрудников, обрыв интернета или сбой у провайдера не должен останавливать работу. Локальная модель крутится на своём железе и не зависит от доступности стороннего API.

На практике так подключали ассистента для юридической компании: договоры и переписка с клиентами не должны были покидать периметр компании, а объём документов был слишком большим, чтобы гонять их через облачный API без риска для конфиденциальности. Через три месяца после запуска локальной модели на своём сервере в компании посчитали, что фиксированные расходы на сервер оказались предсказуемее и заметно дешевле, чем платить по счётчику токенов при таком объёме переписки.

Какие открытые модели можно скачать и запустить у себя

Рынок открытых LLM за два года вырос сильно, и выбор уже не ограничивается одной моделью.

  • Llama 3.1/3.3 от Meta - версии 8B и 70B параметров, хорошо работает как база для дообучения, но лицензия ограничивает коммерческое использование при аудитории свыше 700 млн активных пользователей в месяц.
  • Mistral и Mixtral - французские модели с лицензией Apache 2.0, то есть без ограничений на коммерческое использование. Mixtral устроен как смесь экспертов, поэтому при том же качестве работает быстрее плотных моделей похожего размера.
  • Qwen2.5 от Alibaba - неожиданно сильно держит русский язык и код, часто беру именно её для задач с русскоязычными документами.
  • DeepSeek-R1/V3 - модель с явным рассуждением перед ответом, по бенчмаркам конкурирует с закрытыми моделями на сложных задачах, но требует больше ресурсов на инференс из-за цепочки рассуждений.
  • Saiga - дообученная под русский язык версия Llama от независимого разработчика Ильи Гусева, удобна для чат-ботов, где важна естественная русская речь без переводческого акцента.

Перед выбором модели смотрю не только на бенчмарки, а на лицензию: у части моделей было условие делиться улучшениями с сообществом, что для закрытого корпоративного продукта неудобно.

Что нужно для запуска: железо и инструменты

Модель весом 7B не значит 7 гигабайт на диске - в квантованном виде она занимает меньше, но для комфортной работы нужна видеопамять с запасом.

Квантование - это сжатие весов модели с 16 или 32 бит до 4-8 бит, из-за чего модель занимает меньше памяти и работает быстрее, а качество проседает на процент-два, который на практике редко заметен в задачах вроде ответов по документам. Модели в квантованном виде обычно распространяются в формате GGUF, именно его загружают Ollama и LM Studio.

Размер модели VRAM в 4‑битном квантовании Пример видеокарты
7B 6-8 ГБ RTX 3060/4060
13-14B 10-12 ГБ RTX 4070/3090
32B 20-24 ГБ RTX 4090
70B 40-48 ГБ, обычно две видеокарты 2x RTX 4090 или A100

Если своего сервера с GPU нет, его можно арендовать - у российских провайдеров вроде Selectel, Timeweb Cloud или Cloud.ru на рынке ценник на сервер с RTX 4090 держится примерно в диапазоне 15 000-40 000 рублей в месяц в зависимости от конфигурации. Это не моя цена, а ориентир по рынку хостинга, у каждого провайдера свои тарифы.

Из инструментов для запуска:

  • Ollama - самый быстрый способ попробовать модель локально, одна команда в терминале скачивает и запускает модель с готовым API.
  • LM Studio - то же самое, но с графическим интерфейсом, удобно для нетехнического сотрудника, который хочет протестировать модель на своём ноутбуке.
  • vLLM - для продакшена, когда бот обрабатывает сотни запросов в день: умеет батчить запросы и заметно экономит видеопамять за счёт постраничного управления кешем.
  • llama.cpp - вариант для запуска без видеокарты, на процессоре, медленнее, но работает даже на обычном сервере без GPU для несложных задач.

На практике для прототипа беру Ollama, а при переходе в продакшен переезжаю на vLLM без переписывания остальной интеграции, потому что оба инструмента отдают совместимый с OpenAI формат ответа.

Сравнение: облачный API и локальная нейросеть

Что меняется Облачный API (Claude, OpenAI) Локальная модель на своём сервере
Где хранятся данные клиентов обычно за рубежом на сервере в РФ, под своим контролем
Как считаются расходы по токенам, растёт с нагрузкой фиксированная стоимость сервера
Качество на сложных задачах топовые модели пока сильнее открытые модели отстают на поколение-два
Кто обслуживает провайдер API нужен свой DevOps или подрядчик на техподдержке

По скорости запуска подключение к облачному API занимает часы, локальная модель требует нескольких дней на выбор конфигурации, тесты качества и настройку инфраструктуры - и это без учёта времени на дообучение под свои данные, если оно нужно.

Важно, что переход не обязан быть решением раз и навсегда: часть моих клиентов держит облачный API для сложных задач вроде юридической экспертизы текста и параллельно локальную модель для рутины - классификации обращений, извлечения данных из документов, черновиков ответов.

Бесплатный материал

🎁 Полезный скрипт в подарок

Подпишитесь на Telegram - пришлю готовый скрипт по этой теме.

Без спама. Отписка в 1 клик.

Как встроить скачанную нейросеть в бизнес-процессы

Сама по себе модель на сервере ничего не даёт бизнесу, пока её не подключили к рабочим инструментам. На практике встречаю три сценария.

База знаний с поиском по документам (RAG)

Документы компании режутся на куски, превращаются в векторы и кладутся в векторную базу. При вопросе сотрудника или клиента модель сначала находит релевантные куски текста, потом формирует ответ на их основе - так локальная модель отвечает точно по внутренним документам, а не по общим знаниям из интернета. Для хранения векторов обычно беру Qdrant или pgvector поверх PostgreSQL - оба разворачиваются на своём сервере рядом с моделью, без выноса данных к стороннему провайдеру. Собираю такие решения на связке своего сервера и открытой модели, у меня это оформлено как услуга по внедрению чат-бота с базой знаний, стоимость от 50 000 ₽.

Чат-бот в Telegram

Если бот уже написан на aiogram и раньше стучался в OpenAI, для перехода на локальную модель достаточно поменять эндпоинт: большинство инструментов запуска отдают API, совместимый по формату с OpenAI, поэтому переписывать логику бота почти не приходится.

Автоматизация в n8n

В n8n нода HTTP Request легко заменяет готовую OpenAI-ноду - указываете адрес своего сервера с моделью, и сценарии обработки заявок, писем или классификации лидов продолжают работать без изменений в остальной цепочке. Например, входящая заявка с сайта проходит классификацию по срочности и теме, шаблонный ответ уходит клиенту сразу, а сложные случаи локальная модель помечает для менеджера и передаёт в CRM с готовым резюме обращения.

Если своего сервера пока нет и нужно решение здесь и сейчас, для быстрого старта подойдёт готовый ИИ-чатбот на Claude API из библиотеки скриптов - его можно поставить за пару дней, а к локальной модели перейти позже, когда объём запросов вырастет и станет понятна экономика.

Риски и ограничения локальных нейросетей

Открытая модель на своём сервере это не разовая установка. Обновления версий модели, патчи безопасности инструмента запуска, мониторинг нагрузки на видеокарту - всё это ложится на того, кто держит сервер. У облачного провайдера саппорт отвечает за доступность API, у себя дома отвечать некому, кроме своей команды или подрядчика.

Отдельно слежу за доступом к API модели: если адрес с локальной нейросетью торчит в интернет без авторизации, им может воспользоваться кто угодно, а не только ваш бот. Закрываю такие вещи через авторизацию по токену и ограничение по IP на уровне сервера.

Ещё считаю расход на электричество и износ видеокарты, если сервер стоит в своём офисе, а не в дата-центре: видеокарта под постоянной нагрузкой греется и со временем теряет ресурс, поэтому для круглосуточной работы чаще советую облачный GPU-сервер, а не свой системный блок в серверной комнате.

Ещё момент - качество на нестандартных запросах. На типовых задачах открытые модели работают достаточно ровно. На сложной аналитике или творческих задачах разрыв с топовыми закрытыми моделями пока заметен, и это стоит проверять на своих данных до принятия решения о переходе, а не после.

Держать локальную модель в рабочем состоянии - отдельная задача, и беру её на техническую поддержку отдельно от разработки, от 15 000 ₽ в месяц.

Частые вопросы

Можно ли использовать открытые нейросети бесплатно в коммерческом проекте?

Зависит от лицензии конкретной модели. Mistral и Qwen распространяются по Apache 2.0 без ограничений на коммерческое использование. У Llama лицензия community-типа с оговоркой про крупных игроков с аудиторией свыше 700 млн пользователей в месяц - для обычного бизнеса это не преграда, но лицензию стоит прочитать перед стартом проекта, а не полагаться на пересказы в интернете.

Сколько стоит держать нейросеть на своём сервере?

Зависит от размера модели и нагрузки: сервер с одной видеокартой уровня RTX 4090 у российских провайдеров на рынке стоит примерно 15 000-40 000 рублей в месяц, для 70B-моделей с двумя картами сумма вырастет. Плюс к этому расходы на настройку, интеграцию с вашими системами и последующее сопровождение - разработка AI-интеграций начинается от 50 000 ₽.

Подойдёт ли локальная модель для чат-бота на русском языке?

Да, но не любая модель одинаково хорошо держит русский. Из практики лучше всего с русской речью справляются Qwen2.5 и Saiga, у обычной Llama без дообучения иногда проскакивает калька с английского в построении фраз. Перед запуском тестирую модель именно на реальных вопросах клиентов компании, а не на общих бенчмарках.

Что выбрать - Ollama или vLLM?

Для теста идеи, прототипа или внутреннего инструмента на несколько человек хватает Ollama - её можно поднять за час. Для продакшен-бота с сотнями обращений в день лучше vLLM: она батчит запросы и эффективнее использует видеопамять при параллельной нагрузке, что напрямую влияет на скорость ответа под нагрузкой.

Есть задача?

Обсудим в мессенджере

Расскажите, что нужно сделать — отвечу в течение 4 часов в рабочее время. Первая консультация бесплатно.

Продолжая пользование настоящим сайтом Вы выражаете своё согласие на обработку Ваших персональных данных (файлов куки) с использованием Yandex.Metrika.
Понятно