AI · 7 мин чтения

Сколько стоит YandexGPT API: цена, тарифы и лимиты

Цена YandexGPT API не сводится к одной цифре в прайс-листе - она складывается из выбранной модели, режима запроса и объёма токенов, и разброс между дешёвым и дорогим сценарием использования получается в 10-15 раз. Я подключал YandexGPT в ботах на aiogram, в сценариях n8n и в скриптах для Tilda, и ниже раскладываю, из чего реально собирается счёт в Yandex Cloud и как прикинуть бюджет до того, как отправишь первый запрос.

Как считается цена YandexGPT API: токены, а не подписка

Yandex Cloud не продаёт доступ к YandexGPT по месячной подписке с фиксированным числом запросов - здесь постоплата за токены, как у большинства LLM-провайдеров. Токен - это не слово, а кусок текста: в среднем 1000 токенов дают 700-750 слов связного русского текста, а на технических терминах, коде или адресах соотношение хуже.

В тариф попадают токены на входе (системная инструкция, история диалога, промпт пользователя) и токены на выходе (ответ модели), и оба типа считаются по одной и той же ставке модели - в отличие от OpenAI или Claude, где вход и выход часто стоят по-разному. На практике это означает: чем длиннее системный промпт и чем больше сообщений вы прокидываете как контекст диалога, тем дороже каждый ответ, даже если сама генерация короткая.

На одном проекте, боте поддержки на aiogram для интернет-магазина, я сократил системный промпт с 1200 до 400 токенов и историю диалога с 10 сообщений до 4 последних реплик. Счёт за месяц упал почти вдвое, а качество ответов не изменилось - модель и так не использовала бо́льшую часть контекста по делу.

Проверить, сколько токенов ушло на конкретный запрос, можно прямо в ответе API - в поле usage:

curl -X POST \
  -H "Authorization: Api-Key $YC_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "modelUri": "gpt:///yandexgpt-lite/latest",
    "completionOptions": {"maxTokens": 300},
    "messages": [{"role": "user", "text": "Собери короткий ответ по FAQ"}]
  }' \
  https://llm.api.cloud.yandex.net/foundationModels/v1/completion

В ответе придёт объект usage с inputTextTokens, completionTokens и totalTokens - я логирую эти цифры отдельной строкой в свою таблицу метрик на каждый прогон, и через неделю-две уже видно реальный расход, а не прикидку из документации.

Тарифы YandexGPT Lite и YandexGPT Pro: сколько стоят токены

В Yandex Cloud AI Studio доступно несколько моделей, и цена за 1000 токенов у них отличается в разы. Ниже ориентир по синхронному режиму (тарифы Yandex Cloud периодически меняются, перед закладкой бюджета сверяйтесь с калькулятором в консоли):

Модель Где применять Ориентир цены за 1000 токенов Контекст
YandexGPT Lite короткие ответы, классификация обращений, автодополнение форм, простые чат-боты около 0,20 ₽ до 32 000 токенов
YandexGPT Pro генерация текстов, сложные диалоги, суммаризация, работа с базой знаний около 1,20 ₽ до 32 000 токенов
YandexGPT Pro с расширенным контекстом длинные документы, договоры, большие логи переписки около 1,20-1,50 ₽ плюс доплата за длинный контекст до 128 000 токенов
Embeddings (text-search) векторизация текста для RAG и поиска по базе знаний около 0,02 ₽ -

Lite дешевле Pro в 5-6 раз, и в проектах, где не нужен глубокий анализ - простая классификация обращений, короткие ответы по FAQ, генерация тегов для карточек товаров - я почти всегда сначала пробую Lite. Разница в качестве заметна не на всех задачах, а разница в счёте ощутима сразу же, с первого месяца эксплуатации.

Синхронные и асинхронные запросы: где теряются и находятся деньги

У YandexGPT API есть два режима вызова: синхронный, где вы ждёте ответ прямо в HTTP-соединении, и асинхронный (операция создаётся, а результат забирается отдельным запросом позже). Асинхронный режим обходится заметно дешевле - обычно вполовину от цены синхронного вызова той же модели, потому что Yandex Cloud может ставить такие запросы в очередь и обрабатывать не мгновенно.

Это имеет смысл там, где не нужен ответ здесь и сейчас: пакетная генерация описаний для карточек товаров в WooCommerce, ночная обработка накопившихся тикетов, массовая суммаризация логов переписки. Для 2000 товаров по 800 токенов на вход и выход набегает около 1,6 миллиона токенов - разово это порядка 960 ₽ на Pro в асинхронном режиме против почти 2000 ₽, если гнать те же товары синхронно.

А вот для чат-бота в Telegram или виджета на сайте асинхронный режим не подойдёт - пользователь ждёт ответ секунды, а не минуты, так что там платите по полной ставке синхронного тарифа. Разделение задач на «нужен ответ мгновенно» и «можно подождать» я закладываю в архитектуру ещё на этапе проектирования, а не пытаюсь оптимизировать постфактум.

Бесплатный материал

🎁 Полезный скрипт в подарок

Подпишитесь на Telegram - пришлю готовый скрипт по этой теме.

Без спама. Отписка в 1 клик.

Эмбеддинги и RAG: отдельная статья расходов при работе с базой знаний

Если бот должен отвечать по вашей базе знаний, а не только по общим знаниям модели, в расчёт добавляется два новых источника токенов. Первый - индексация: каждый документ или кусок базы режется на чанки и прогоняется через embeddings-модель, чтобы получить векторы для поиска. Это дёшево само по себе (около 0,02 ₽ за 1000 токенов), но объём большой - база из 5000 документов по 500 токенов даёт 2,5 миллиона токенов на индексацию, то есть разово порядка 50 ₽.

Второй источник дороже и незаметнее: при каждом обращении пользователя система вытаскивает из базы несколько релевантных чанков и вставляет их в промпт вместе с вопросом. Если на один ответ уходит 3000 токенов контекста вместо 300, ваш счёт за генерацию вырастает не в разы, а на порядок, хотя количество диалогов не изменилось. Я на практике вижу именно эту ошибку чаще всего: RAG подключили, а количество чанков и их размер никто не подбирал под задачу, и API молча ест бюджет.

Если задача - не эксперимент, а рабочая интеграция YandexGPT в CRM, сайт на Tilda или бэкенд магазина с прогнозируемой нагрузкой, я делаю интеграции с YandexGPT и другими LLM API с расчётом токенов под конкретный поток обращений, а не по методичке из документации.

Лимиты и квоты YandexGPT API: RPS, очереди, отказ в обслуживании

Помимо цены за токены есть ограничение по скорости запросов - RPS (requests per second). У новых аккаунтов квота обычно небольшая, и если бот резко получает всплеск обращений, часть запросов начинает падать с ошибкой 429. Увеличение квоты делается через консоль Yandex Cloud или обращение в поддержку, и закладывать на это стоит несколько рабочих дней, а не рассчитывать на мгновенное расширение в день запуска рекламной кампании.

На одном проекте с ботом на aiogram, где интеграция дёргала YandexGPT в ответ на каждое сообщение без очереди, дневная рассылка по базе клиентов положила бота именно из-за лимита RPS, а не из-за нагрузки на сервер. Решение было в n8n: между входящим сообщением и вызовом модели встала очередь с ограничением скорости и повторными попытками с задержкой, и всплески перестали приводить к отказам.

Второе ограничение - размер контекста модели. Даже если у вас хватает денег на токены, превышение максимального контекста (32 000 или 128 000 токенов в зависимости от версии) просто вернёт ошибку, и придётся резать историю диалога или чанки базы знаний перед отправкой запроса.

Как посчитать бюджет на практике: три сценария

Проще всего прикинуть цену на конкретных цифрах, а не на абстрактных «токенах вообще». Вот три реальных по структуре сценария:

Сценарий Токены в месяц (оценка) Модель и режим Ориентировочная цена
Бот поддержки в Telegram, короткие ответы по FAQ, 500 диалогов в день ~22,5 млн YandexGPT Lite, синхронно ~4 500 ₽/мес
Пакетная генерация описаний для 2000 карточек товаров в WooCommerce ~1,6 млн разово YandexGPT Pro, асинхронно ~960 ₽ разово
Чат-бот с базой знаний (RAG), 300 обращений в день ~27 млн + 2,5 млн на индексацию YandexGPT Pro + Embeddings ~32 000-33 000 ₽/мес

Разница на порядок между первым и третьим сценарием не в количестве диалогов, а в размере контекста: RAG тянет в каждый запрос куски базы знаний, и это токены, за которые платите так же, как за сообщение пользователя. Прежде чем закладывать бюджет на RAG-бота, я всегда прогоняю тестовую неделю с логированием токенов на реальных вопросах - прогноз «на глаз» обычно расходится с фактом в полтора-два раза.

Новым аккаунтам Yandex Cloud обычно даёт пробный грант на несколько тысяч рублей, действующий ограниченное время - его хватает, чтобы прогнать тесты и снять реальные цифры расхода токенов, но не хватит для полноценной эксплуатации бота с живым трафиком.

Частые вопросы

Есть ли у YandexGPT API постоянный бесплатный тариф?

Постоянного бесплатного тарифа нет, только пробный грант для новых аккаунтов Yandex Cloud, ограниченный по сумме и сроку действия. Его хватает на тесты и прикидку расхода токенов, но для бота с реальным потоком обращений это не покрывает даже первый месяц.

Что дешевле для чат-бота: YandexGPT или зарубежные модели вроде Claude?

YandexGPT Lite обычно дешевле зарубежных аналогов на задачах с русским языком и простой логикой ответов, а на сложных рассуждениях, длинных инструкциях и работе с кодом топовые модели вроде Claude часто выигрывают по качеству ответа при сопоставимой или большей цене за токен. Выбор стоит делать не по одной цифре тарифа, а по тому, сколько токенов реально уйдёт на задачу и сколько правок потребует результат.

Как прикинуть месячный бюджет, если ещё не знаешь точное число обращений?

Запускаю тестовый прогон на 1-2 недели с логированием токенов из поля usage на каждый запрос, считаю среднее число токенов на диалог и умножаю на прогноз нагрузки с запасом 20-30%. Это точнее любых оценок «по документации», потому что реальный размер системного промпта, истории диалога и RAG-контекста у каждого проекта свой.

Почему счёт за YandexGPT API вырос неожиданно?

Чаще всего дело в трёх вещах: разросшейся истории диалога, которая целиком уходит в контекст каждого запроса, повторных вызовах из-за таймаутов и ретраев в боте или сценарии n8n, и увеличении числа или размера чанков в RAG-поиске. Проверяю логи в этом порядке и почти всегда нахожу причину в первых двух пунктах, а не в изменении тарифов.

Есть задача?

Обсудим в мессенджере

Расскажите, что нужно сделать — отвечу в течение 4 часов в рабочее время. Первая консультация бесплатно.

Продолжая пользование настоящим сайтом Вы выражаете своё согласие на обработку Ваших персональных данных (файлов куки) с использованием Yandex.Metrika.
Понятно