Цена YandexGPT API не сводится к одной цифре в прайс-листе - она складывается из выбранной модели, режима запроса и объёма токенов, и разброс между дешёвым и дорогим сценарием использования получается в 10-15 раз. Я подключал YandexGPT в ботах на aiogram, в сценариях n8n и в скриптах для Tilda, и ниже раскладываю, из чего реально собирается счёт в Yandex Cloud и как прикинуть бюджет до того, как отправишь первый запрос.
По теме статьи
Готовое решение
AI-чатбот для сайта на Claude - отвечает как ваш менеджер, работает 24/7
Подключу к вашему сайту чат-бота на Claude API. Бот отвечает на вопросы клиентов голосом вашего бренда, знает каталог и условия доставки, забирает лиды в CRM или Telegram.
от25 000 ₽
AI / Claude API
Искусственный интеллект для бизнеса
AI-чатбот на сайт с базой знаний, автообработка заявок, генерация контента, умный парсинг. Claude API, OpenAI, RAG.
от50 000 ₽
Как считается цена YandexGPT API: токены, а не подписка
Yandex Cloud не продаёт доступ к YandexGPT по месячной подписке с фиксированным числом запросов - здесь постоплата за токены, как у большинства LLM-провайдеров. Токен - это не слово, а кусок текста: в среднем 1000 токенов дают 700-750 слов связного русского текста, а на технических терминах, коде или адресах соотношение хуже.
В тариф попадают токены на входе (системная инструкция, история диалога, промпт пользователя) и токены на выходе (ответ модели), и оба типа считаются по одной и той же ставке модели - в отличие от OpenAI или Claude, где вход и выход часто стоят по-разному. На практике это означает: чем длиннее системный промпт и чем больше сообщений вы прокидываете как контекст диалога, тем дороже каждый ответ, даже если сама генерация короткая.
На одном проекте, боте поддержки на aiogram для интернет-магазина, я сократил системный промпт с 1200 до 400 токенов и историю диалога с 10 сообщений до 4 последних реплик. Счёт за месяц упал почти вдвое, а качество ответов не изменилось - модель и так не использовала бо́льшую часть контекста по делу.
Проверить, сколько токенов ушло на конкретный запрос, можно прямо в ответе API - в поле usage:
curl -X POST \
-H "Authorization: Api-Key $YC_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"modelUri": "gpt:///yandexgpt-lite/latest",
"completionOptions": {"maxTokens": 300},
"messages": [{"role": "user", "text": "Собери короткий ответ по FAQ"}]
}' \
https://llm.api.cloud.yandex.net/foundationModels/v1/completion
В ответе придёт объект usage с inputTextTokens, completionTokens и totalTokens - я логирую эти цифры отдельной строкой в свою таблицу метрик на каждый прогон, и через неделю-две уже видно реальный расход, а не прикидку из документации.
Тарифы YandexGPT Lite и YandexGPT Pro: сколько стоят токены
В Yandex Cloud AI Studio доступно несколько моделей, и цена за 1000 токенов у них отличается в разы. Ниже ориентир по синхронному режиму (тарифы Yandex Cloud периодически меняются, перед закладкой бюджета сверяйтесь с калькулятором в консоли):
| Модель | Где применять | Ориентир цены за 1000 токенов | Контекст |
|---|---|---|---|
| YandexGPT Lite | короткие ответы, классификация обращений, автодополнение форм, простые чат-боты | около 0,20 ₽ | до 32 000 токенов |
| YandexGPT Pro | генерация текстов, сложные диалоги, суммаризация, работа с базой знаний | около 1,20 ₽ | до 32 000 токенов |
| YandexGPT Pro с расширенным контекстом | длинные документы, договоры, большие логи переписки | около 1,20-1,50 ₽ плюс доплата за длинный контекст | до 128 000 токенов |
| Embeddings (text-search) | векторизация текста для RAG и поиска по базе знаний | около 0,02 ₽ | - |
Lite дешевле Pro в 5-6 раз, и в проектах, где не нужен глубокий анализ - простая классификация обращений, короткие ответы по FAQ, генерация тегов для карточек товаров - я почти всегда сначала пробую Lite. Разница в качестве заметна не на всех задачах, а разница в счёте ощутима сразу же, с первого месяца эксплуатации.
Синхронные и асинхронные запросы: где теряются и находятся деньги
У YandexGPT API есть два режима вызова: синхронный, где вы ждёте ответ прямо в HTTP-соединении, и асинхронный (операция создаётся, а результат забирается отдельным запросом позже). Асинхронный режим обходится заметно дешевле - обычно вполовину от цены синхронного вызова той же модели, потому что Yandex Cloud может ставить такие запросы в очередь и обрабатывать не мгновенно.
Это имеет смысл там, где не нужен ответ здесь и сейчас: пакетная генерация описаний для карточек товаров в WooCommerce, ночная обработка накопившихся тикетов, массовая суммаризация логов переписки. Для 2000 товаров по 800 токенов на вход и выход набегает около 1,6 миллиона токенов - разово это порядка 960 ₽ на Pro в асинхронном режиме против почти 2000 ₽, если гнать те же товары синхронно.
А вот для чат-бота в Telegram или виджета на сайте асинхронный режим не подойдёт - пользователь ждёт ответ секунды, а не минуты, так что там платите по полной ставке синхронного тарифа. Разделение задач на «нужен ответ мгновенно» и «можно подождать» я закладываю в архитектуру ещё на этапе проектирования, а не пытаюсь оптимизировать постфактум.
Бесплатный материал
🎁 Полезный скрипт в подарок
Подпишитесь на Telegram - пришлю готовый скрипт по этой теме.
Без спама. Отписка в 1 клик.
Эмбеддинги и RAG: отдельная статья расходов при работе с базой знаний
Если бот должен отвечать по вашей базе знаний, а не только по общим знаниям модели, в расчёт добавляется два новых источника токенов. Первый - индексация: каждый документ или кусок базы режется на чанки и прогоняется через embeddings-модель, чтобы получить векторы для поиска. Это дёшево само по себе (около 0,02 ₽ за 1000 токенов), но объём большой - база из 5000 документов по 500 токенов даёт 2,5 миллиона токенов на индексацию, то есть разово порядка 50 ₽.
Второй источник дороже и незаметнее: при каждом обращении пользователя система вытаскивает из базы несколько релевантных чанков и вставляет их в промпт вместе с вопросом. Если на один ответ уходит 3000 токенов контекста вместо 300, ваш счёт за генерацию вырастает не в разы, а на порядок, хотя количество диалогов не изменилось. Я на практике вижу именно эту ошибку чаще всего: RAG подключили, а количество чанков и их размер никто не подбирал под задачу, и API молча ест бюджет.
Если задача - не эксперимент, а рабочая интеграция YandexGPT в CRM, сайт на Tilda или бэкенд магазина с прогнозируемой нагрузкой, я делаю интеграции с YandexGPT и другими LLM API с расчётом токенов под конкретный поток обращений, а не по методичке из документации.
Лимиты и квоты YandexGPT API: RPS, очереди, отказ в обслуживании
Помимо цены за токены есть ограничение по скорости запросов - RPS (requests per second). У новых аккаунтов квота обычно небольшая, и если бот резко получает всплеск обращений, часть запросов начинает падать с ошибкой 429. Увеличение квоты делается через консоль Yandex Cloud или обращение в поддержку, и закладывать на это стоит несколько рабочих дней, а не рассчитывать на мгновенное расширение в день запуска рекламной кампании.
На одном проекте с ботом на aiogram, где интеграция дёргала YandexGPT в ответ на каждое сообщение без очереди, дневная рассылка по базе клиентов положила бота именно из-за лимита RPS, а не из-за нагрузки на сервер. Решение было в n8n: между входящим сообщением и вызовом модели встала очередь с ограничением скорости и повторными попытками с задержкой, и всплески перестали приводить к отказам.
Второе ограничение - размер контекста модели. Даже если у вас хватает денег на токены, превышение максимального контекста (32 000 или 128 000 токенов в зависимости от версии) просто вернёт ошибку, и придётся резать историю диалога или чанки базы знаний перед отправкой запроса.
Как посчитать бюджет на практике: три сценария
Проще всего прикинуть цену на конкретных цифрах, а не на абстрактных «токенах вообще». Вот три реальных по структуре сценария:
| Сценарий | Токены в месяц (оценка) | Модель и режим | Ориентировочная цена |
|---|---|---|---|
| Бот поддержки в Telegram, короткие ответы по FAQ, 500 диалогов в день | ~22,5 млн | YandexGPT Lite, синхронно | ~4 500 ₽/мес |
| Пакетная генерация описаний для 2000 карточек товаров в WooCommerce | ~1,6 млн разово | YandexGPT Pro, асинхронно | ~960 ₽ разово |
| Чат-бот с базой знаний (RAG), 300 обращений в день | ~27 млн + 2,5 млн на индексацию | YandexGPT Pro + Embeddings | ~32 000-33 000 ₽/мес |
Разница на порядок между первым и третьим сценарием не в количестве диалогов, а в размере контекста: RAG тянет в каждый запрос куски базы знаний, и это токены, за которые платите так же, как за сообщение пользователя. Прежде чем закладывать бюджет на RAG-бота, я всегда прогоняю тестовую неделю с логированием токенов на реальных вопросах - прогноз «на глаз» обычно расходится с фактом в полтора-два раза.
Новым аккаунтам Yandex Cloud обычно даёт пробный грант на несколько тысяч рублей, действующий ограниченное время - его хватает, чтобы прогнать тесты и снять реальные цифры расхода токенов, но не хватит для полноценной эксплуатации бота с живым трафиком.
Частые вопросы
Есть ли у YandexGPT API постоянный бесплатный тариф?
Постоянного бесплатного тарифа нет, только пробный грант для новых аккаунтов Yandex Cloud, ограниченный по сумме и сроку действия. Его хватает на тесты и прикидку расхода токенов, но для бота с реальным потоком обращений это не покрывает даже первый месяц.
Что дешевле для чат-бота: YandexGPT или зарубежные модели вроде Claude?
YandexGPT Lite обычно дешевле зарубежных аналогов на задачах с русским языком и простой логикой ответов, а на сложных рассуждениях, длинных инструкциях и работе с кодом топовые модели вроде Claude часто выигрывают по качеству ответа при сопоставимой или большей цене за токен. Выбор стоит делать не по одной цифре тарифа, а по тому, сколько токенов реально уйдёт на задачу и сколько правок потребует результат.
Как прикинуть месячный бюджет, если ещё не знаешь точное число обращений?
Запускаю тестовый прогон на 1-2 недели с логированием токенов из поля usage на каждый запрос, считаю среднее число токенов на диалог и умножаю на прогноз нагрузки с запасом 20-30%. Это точнее любых оценок «по документации», потому что реальный размер системного промпта, истории диалога и RAG-контекста у каждого проекта свой.
Почему счёт за YandexGPT API вырос неожиданно?
Чаще всего дело в трёх вещах: разросшейся истории диалога, которая целиком уходит в контекст каждого запроса, повторных вызовах из-за таймаутов и ретраев в боте или сценарии n8n, и увеличении числа или размера чанков в RAG-поиске. Проверяю логи в этом порядке и почти всегда нахожу причину в первых двух пунктах, а не в изменении тарифов.