За последний год ко мне стало чаще приходить одно и то же: клиенты хотят нейросети для бизнеса скачать и держать на своём сервере, а не платить каждый месяц за облачный API и не отправлять переписку с клиентами на серверы за рубежом. Причины разные: у кого-то персональные данные клиентов, у кого-то просто надоело зависеть от курса доллара в счетах за токены. Расскажу, что реально можно скачать, сколько это стоит по железу и куда такие проекты упираются на практике.
По теме статьи
Готовое решение
AI-чатбот для сайта на Claude - отвечает как ваш менеджер, работает 24/7
Подключу к вашему сайту чат-бота на Claude API. Бот отвечает на вопросы клиентов голосом вашего бренда, знает каталог и условия доставки, забирает лиды в CRM или Telegram.
от25 000 ₽
AI / Claude API
Искусственный интеллект для бизнеса
AI-чатбот на сайт с базой знаний, автообработка заявок, генерация контента, умный парсинг. Claude API, OpenAI, RAG.
от50 000 ₽
Зачем скачивать нейросеть, а не подключать облачный API
Три причины, с которыми ко мне приходят чаще всего. Первая - персональные данные. Если бот работает с перепиской клиентов, историей болезни, финансовыми документами, хранить это на серверах OpenAI или Anthropic формально не запрещено, но по 152-ФЗ персональные данные россиян обязаны обрабатываться на серверах в РФ. Локальная модель на своём сервере в Москве или Петербурге снимает этот вопрос сразу.
Вторая причина - предсказуемость расходов. Облачный API считает деньги по токенам, и при потоке в несколько тысяч запросов в день счёт может вырасти в разы за месяц без предупреждения. Сервер с видеокартой стоит фиксированную сумму независимо от нагрузки.
Третья - автономность. Если у компании внутренний инструмент вроде поиска по документам или помощника для сотрудников, обрыв интернета или сбой у провайдера не должен останавливать работу. Локальная модель крутится на своём железе и не зависит от доступности стороннего API.
На практике так подключали ассистента для юридической компании: договоры и переписка с клиентами не должны были покидать периметр компании, а объём документов был слишком большим, чтобы гонять их через облачный API без риска для конфиденциальности. Через три месяца после запуска локальной модели на своём сервере в компании посчитали, что фиксированные расходы на сервер оказались предсказуемее и заметно дешевле, чем платить по счётчику токенов при таком объёме переписки.
Какие открытые модели можно скачать и запустить у себя
Рынок открытых LLM за два года вырос сильно, и выбор уже не ограничивается одной моделью.
- Llama 3.1/3.3 от Meta - версии 8B и 70B параметров, хорошо работает как база для дообучения, но лицензия ограничивает коммерческое использование при аудитории свыше 700 млн активных пользователей в месяц.
- Mistral и Mixtral - французские модели с лицензией Apache 2.0, то есть без ограничений на коммерческое использование. Mixtral устроен как смесь экспертов, поэтому при том же качестве работает быстрее плотных моделей похожего размера.
- Qwen2.5 от Alibaba - неожиданно сильно держит русский язык и код, часто беру именно её для задач с русскоязычными документами.
- DeepSeek-R1/V3 - модель с явным рассуждением перед ответом, по бенчмаркам конкурирует с закрытыми моделями на сложных задачах, но требует больше ресурсов на инференс из-за цепочки рассуждений.
- Saiga - дообученная под русский язык версия Llama от независимого разработчика Ильи Гусева, удобна для чат-ботов, где важна естественная русская речь без переводческого акцента.
Перед выбором модели смотрю не только на бенчмарки, а на лицензию: у части моделей было условие делиться улучшениями с сообществом, что для закрытого корпоративного продукта неудобно.
Что нужно для запуска: железо и инструменты
Модель весом 7B не значит 7 гигабайт на диске - в квантованном виде она занимает меньше, но для комфортной работы нужна видеопамять с запасом.
Квантование - это сжатие весов модели с 16 или 32 бит до 4-8 бит, из-за чего модель занимает меньше памяти и работает быстрее, а качество проседает на процент-два, который на практике редко заметен в задачах вроде ответов по документам. Модели в квантованном виде обычно распространяются в формате GGUF, именно его загружают Ollama и LM Studio.
| Размер модели | VRAM в 4‑битном квантовании | Пример видеокарты |
|---|---|---|
| 7B | 6-8 ГБ | RTX 3060/4060 |
| 13-14B | 10-12 ГБ | RTX 4070/3090 |
| 32B | 20-24 ГБ | RTX 4090 |
| 70B | 40-48 ГБ, обычно две видеокарты | 2x RTX 4090 или A100 |
Если своего сервера с GPU нет, его можно арендовать - у российских провайдеров вроде Selectel, Timeweb Cloud или Cloud.ru на рынке ценник на сервер с RTX 4090 держится примерно в диапазоне 15 000-40 000 рублей в месяц в зависимости от конфигурации. Это не моя цена, а ориентир по рынку хостинга, у каждого провайдера свои тарифы.
Из инструментов для запуска:
- Ollama - самый быстрый способ попробовать модель локально, одна команда в терминале скачивает и запускает модель с готовым API.
- LM Studio - то же самое, но с графическим интерфейсом, удобно для нетехнического сотрудника, который хочет протестировать модель на своём ноутбуке.
- vLLM - для продакшена, когда бот обрабатывает сотни запросов в день: умеет батчить запросы и заметно экономит видеопамять за счёт постраничного управления кешем.
- llama.cpp - вариант для запуска без видеокарты, на процессоре, медленнее, но работает даже на обычном сервере без GPU для несложных задач.
На практике для прототипа беру Ollama, а при переходе в продакшен переезжаю на vLLM без переписывания остальной интеграции, потому что оба инструмента отдают совместимый с OpenAI формат ответа.
Сравнение: облачный API и локальная нейросеть
| Что меняется | Облачный API (Claude, OpenAI) | Локальная модель на своём сервере |
|---|---|---|
| Где хранятся данные клиентов | обычно за рубежом | на сервере в РФ, под своим контролем |
| Как считаются расходы | по токенам, растёт с нагрузкой | фиксированная стоимость сервера |
| Качество на сложных задачах | топовые модели пока сильнее | открытые модели отстают на поколение-два |
| Кто обслуживает | провайдер API | нужен свой DevOps или подрядчик на техподдержке |
По скорости запуска подключение к облачному API занимает часы, локальная модель требует нескольких дней на выбор конфигурации, тесты качества и настройку инфраструктуры - и это без учёта времени на дообучение под свои данные, если оно нужно.
Важно, что переход не обязан быть решением раз и навсегда: часть моих клиентов держит облачный API для сложных задач вроде юридической экспертизы текста и параллельно локальную модель для рутины - классификации обращений, извлечения данных из документов, черновиков ответов.
Бесплатный материал
🎁 Полезный скрипт в подарок
Подпишитесь на Telegram - пришлю готовый скрипт по этой теме.
Без спама. Отписка в 1 клик.
Как встроить скачанную нейросеть в бизнес-процессы
Сама по себе модель на сервере ничего не даёт бизнесу, пока её не подключили к рабочим инструментам. На практике встречаю три сценария.
База знаний с поиском по документам (RAG)
Документы компании режутся на куски, превращаются в векторы и кладутся в векторную базу. При вопросе сотрудника или клиента модель сначала находит релевантные куски текста, потом формирует ответ на их основе - так локальная модель отвечает точно по внутренним документам, а не по общим знаниям из интернета. Для хранения векторов обычно беру Qdrant или pgvector поверх PostgreSQL - оба разворачиваются на своём сервере рядом с моделью, без выноса данных к стороннему провайдеру. Собираю такие решения на связке своего сервера и открытой модели, у меня это оформлено как услуга по внедрению чат-бота с базой знаний, стоимость от 50 000 ₽.
Чат-бот в Telegram
Если бот уже написан на aiogram и раньше стучался в OpenAI, для перехода на локальную модель достаточно поменять эндпоинт: большинство инструментов запуска отдают API, совместимый по формату с OpenAI, поэтому переписывать логику бота почти не приходится.
Автоматизация в n8n
В n8n нода HTTP Request легко заменяет готовую OpenAI-ноду - указываете адрес своего сервера с моделью, и сценарии обработки заявок, писем или классификации лидов продолжают работать без изменений в остальной цепочке. Например, входящая заявка с сайта проходит классификацию по срочности и теме, шаблонный ответ уходит клиенту сразу, а сложные случаи локальная модель помечает для менеджера и передаёт в CRM с готовым резюме обращения.
Если своего сервера пока нет и нужно решение здесь и сейчас, для быстрого старта подойдёт готовый ИИ-чатбот на Claude API из библиотеки скриптов - его можно поставить за пару дней, а к локальной модели перейти позже, когда объём запросов вырастет и станет понятна экономика.
Риски и ограничения локальных нейросетей
Открытая модель на своём сервере это не разовая установка. Обновления версий модели, патчи безопасности инструмента запуска, мониторинг нагрузки на видеокарту - всё это ложится на того, кто держит сервер. У облачного провайдера саппорт отвечает за доступность API, у себя дома отвечать некому, кроме своей команды или подрядчика.
Отдельно слежу за доступом к API модели: если адрес с локальной нейросетью торчит в интернет без авторизации, им может воспользоваться кто угодно, а не только ваш бот. Закрываю такие вещи через авторизацию по токену и ограничение по IP на уровне сервера.
Ещё считаю расход на электричество и износ видеокарты, если сервер стоит в своём офисе, а не в дата-центре: видеокарта под постоянной нагрузкой греется и со временем теряет ресурс, поэтому для круглосуточной работы чаще советую облачный GPU-сервер, а не свой системный блок в серверной комнате.
Ещё момент - качество на нестандартных запросах. На типовых задачах открытые модели работают достаточно ровно. На сложной аналитике или творческих задачах разрыв с топовыми закрытыми моделями пока заметен, и это стоит проверять на своих данных до принятия решения о переходе, а не после.
Держать локальную модель в рабочем состоянии - отдельная задача, и беру её на техническую поддержку отдельно от разработки, от 15 000 ₽ в месяц.
Частые вопросы
Можно ли использовать открытые нейросети бесплатно в коммерческом проекте?
Зависит от лицензии конкретной модели. Mistral и Qwen распространяются по Apache 2.0 без ограничений на коммерческое использование. У Llama лицензия community-типа с оговоркой про крупных игроков с аудиторией свыше 700 млн пользователей в месяц - для обычного бизнеса это не преграда, но лицензию стоит прочитать перед стартом проекта, а не полагаться на пересказы в интернете.
Сколько стоит держать нейросеть на своём сервере?
Зависит от размера модели и нагрузки: сервер с одной видеокартой уровня RTX 4090 у российских провайдеров на рынке стоит примерно 15 000-40 000 рублей в месяц, для 70B-моделей с двумя картами сумма вырастет. Плюс к этому расходы на настройку, интеграцию с вашими системами и последующее сопровождение - разработка AI-интеграций начинается от 50 000 ₽.
Подойдёт ли локальная модель для чат-бота на русском языке?
Да, но не любая модель одинаково хорошо держит русский. Из практики лучше всего с русской речью справляются Qwen2.5 и Saiga, у обычной Llama без дообучения иногда проскакивает калька с английского в построении фраз. Перед запуском тестирую модель именно на реальных вопросах клиентов компании, а не на общих бенчмарках.
Что выбрать - Ollama или vLLM?
Для теста идеи, прототипа или внутреннего инструмента на несколько человек хватает Ollama - её можно поднять за час. Для продакшен-бота с сотнями обращений в день лучше vLLM: она батчит запросы и эффективнее использует видеопамять при параллельной нагрузке, что напрямую влияет на скорость ответа под нагрузкой.