Когда клиент просит поставить на сайт генератор изображений, нейросеть внутри может быть совершенно разной, и от этого зависит и цена интеграции, и то, что вообще получится сделать. За последний год я подключал генерацию картинок и в Telegram-ботов на aiogram, и в сценарии n8n, и в кастомные скрипты для сайтов, и каждый раз выбор модели решал добрую половину задачи. Разница не в том, какая картинка красивее - у Midjourney, GPT Image, Stable Diffusion, Flux и Kandinsky разная архитектура, разные условия на коммерческое использование и разный доступ по API, и путать эти вещи дорого обходится в проекте.
По теме статьи
Готовое решение
AI-чатбот для сайта на Claude - отвечает как ваш менеджер, работает 24/7
Подключу к вашему сайту чат-бота на Claude API. Бот отвечает на вопросы клиентов голосом вашего бренда, знает каталог и условия доставки, забирает лиды в CRM или Telegram.
от25 000 ₽
AI / Claude API
Искусственный интеллект для бизнеса
AI-чатбот на сайт с базой знаний, автообработка заявок, генерация контента, умный парсинг. Claude API, OpenAI, RAG.
от50 000 ₽
Что скрывается под капотом: диффузия против трансформеров
Большинство сервисов, включая Midjourney, Stable Diffusion и Flux, строят картинку через диффузионный процесс: модель стартует с шума и на десятках шагов постепенно превращает его в изображение, ориентируясь на текстовый промт через отдельный языковой энкодер. Это дает сильный контроль над стилем и композицией, хорошо работает с ControlNet и img2img, но у диффузионных моделей исторически слабое место - текст внутри картинки: вывески, надписи на упаковке, цифры на циферблате часто получаются кашей.
GPT Image от OpenAI устроен иначе: генерация встроена в языковую модель, которая понимает промт токен за токеном и предсказывает содержимое изображения с учетом контекста всего запроса. За счет этого такие модели заметно точнее следуют сложным промтам с несколькими объектами и условиями и куда увереннее рисуют читаемый текст. Плата за это - меньше ручного контроля над стилем: подкрутить конкретную деталь через маску получается не так гибко, как в связке Stable Diffusion плюс ControlNet.
На практике это означает: если нужна одна красивая картинка под конкретный арт-стиль - берешь диффузионную модель. Если нужен макет баннера с читаемой надписью или сложная сцена с точным соблюдением условий из промта - обычно ближе к цели GPT-image.
Midjourney: за что беру и где он неудобен для интеграции
Midjourney остается ориентиром по художественному качеству картинки: цвет, свет, композиция - там модель обучена так, что даже короткий промт выдает что-то, похожее на арт, а не на генерацию. Для маркетинговых креативов, обложек и разовых иллюстраций для блога я до сих пор беру именно его.
Проблема начинается, когда картинку нужно генерировать не вручную, а по кнопке в интерфейсе клиента или по событию в CRM. Официального публичного API у Midjourney нет, доступ идет через веб-интерфейс или Discord-бота, и любая автоматизация строится на неофициальных обертках, которые нарушают условия использования сервиса и могут прекратить работать в любой момент без предупреждения. Для одноразовой отрисовки сотни картинок дизайнером это не проблема, а вот встраивать Midjourney в рабочий сценарий бота или сайта - плохая идея, я в такие интеграции клиентов сознательно не веду.
GPT-image: когда нужен официальный API, а не веб-версия
OpenAI дает генерацию картинок как часть своего API, с оплатой за каждое изображение и понятными лимитами - это ровно то, что нужно для автоматизации. В сценарии n8n это одна HTTP-нода: получил заявку из формы на сайте, собрал промт из полей, отправил запрос к API, получил ссылку на картинку, отправил в Telegram или сохранил в базу. В aiogram-боте то же самое укладывается в один хендлер: пользователь присылает описание, бот дергает API и возвращает результат за несколько секунд.
Цена за одно изображение у OpenAI ощутимо выше, чем себестоимость генерации на своем сервере со Stable Diffusion, зато не нужно поднимать и обслуживать GPU-инфраструктуру, а качество следования сложным промтам и читаемый текст на картинке часто перевешивают разницу в цене, особенно если генераций у клиента немного - десятки в день, а не тысячи.
Бесплатный материал
🎁 Полезный скрипт в подарок
Подпишитесь на Telegram - пришлю готовый скрипт по этой теме.
Без спама. Отписка в 1 клик.
Stable Diffusion, Flux и другие опенсорсные модели: свой сервер вместо подписки
Stable Diffusion и Flux распространяются с открытыми весами, их можно развернуть на своем сервере через Automatic1111 или ComfyUI и генерировать сколько угодно картинок без оплаты за каждый запрос - платишь только за аренду GPU, будь то Yandex Cloud, RunPod или свое железо. Это разумно, когда объем генераций большой: например, интернет-магазину нужно регулярно готовить вариации карточек товара или баннеры под каждую акцию.
Главный плюс такого подхода - тонкая настройка под бренд через LoRA: модель дообучается на референсах клиента и потом стабильно выдает картинки в узнаваемом стиле, чего не добиться промтами в закрытых сервисах. Минус - лицензии отличаются от версии к версии: часть моделей Flux доступна бесплатно только для некоммерческого использования, а для бизнеса нужна платная Pro-версия по API, и это нужно проверять до старта проекта, а не после того как картинки уже разошлись по рекламным баннерам.
Kandinsky и российские модели: когда это оправдано
Kandinsky от Sber и модели через FusionBrain API проигрывают Midjourney и GPT-image в сложных многообъектных сценах, но выигрывают там, где важна юрисдикция: данные и запросы остаются на серверах в России, оплата в рублях без карты с международным доступом, а для корпоративных клиентов с чувствительными требованиями к обработке данных это часто перевешивает разницу в качестве картинки. Я закладываю российские модели в проекты, где заказчик прямо просит не выводить обработку за периметр РФ, а не как компромисс по цене.
Как выбрать генератор под задачу
| Сервис | Доступ | Коммерческая лицензия | Где силен |
| Midjourney | только веб/Discord, официального API нет | да, на платной подписке | художественное качество, разовые креативы |
| GPT-image | официальный API, оплата за изображение | да, по условиям OpenAI | сложные промты, читаемый текст на картинке |
| Stable Diffusion / Flux | self-host, свой сервер или облако | зависит от версии модели | большие объемы, тонкая настройка под бренд |
| Kandinsky | API, оплата в рублях | да, по условиям сервиса | требования к хранению данных в РФ |
Если задача не разовая генерация одной картинки, а встраивание в рабочий процесс - бота, CRM, сайт, - гораздо дешевле сразу спроектировать доступ к нужному API на этапе аналитики, а не переписывать интеграцию потом, когда выяснится, что выбранный сервис не отдает данные по API или лицензия не покрывает коммерческое использование. Я обычно веду такие задачи через разработку AI-интеграций именно с этого вопроса: откуда картинка берется технически и что с ней разрешено делать дальше.
Если планируется собирать сгенерированные пользователями изображения и привязывать их к личным данным - имени, номеру телефона, заявке, - храню такие данные на серверах в России, а не в зарубежных облаках, независимо от того, какой генератор картинок используется под капотом: это требование 152-ФЗ о локализации персональных данных, а не рекомендация на выбор.
Частые вопросы
Можно ли использовать картинки из Midjourney в коммерческом проекте?
На платной подписке - да, права на сгенерированные изображения по условиям сервиса переходят пользователю. Но автоматизировать процесс не получится: официального API нет, и картинки придется отрисовывать вручную через веб-интерфейс, а не по запросу с сайта или из бота.
Чем генератор изображений на диффузионной модели отличается от GPT-image по качеству текста на картинке?
Диффузионные модели вроде Stable Diffusion и Midjourney чаще искажают буквы и цифры внутри изображения, потому что рисуют картинку целиком через шум, а не текст по токенам. GPT-image связан с языковой моделью напрямую, поэтому заметно увереннее рисует читаемые надписи на баннерах и упаковке - DALL·E 3, с которой раньше сравнивали, в мае 2026 года убрали из API.
Сколько стоит подключить генератор изображений к Telegram-боту?
Telegram-бот на aiogram у меня начинается от 30 000 ₽, а интеграция с генерацией изображений через API считается отдельно как AI-интеграция от 50 000 ₽ - итоговая цена зависит от того, нужна ли модерация промтов, лимиты на пользователя и хранение истории генераций.
Нужно ли хранить сгенерированные пользователями изображения в облаке за рубежом?
Если изображение связано с личными данными пользователя - именем, номером, заявкой, - хранить его нужно на серверах в России независимо от того, какой генератор картинок стоит в основе сервиса. Это требование локализации персональных данных по 152-ФЗ, а не вопрос удобства.