Открываю биллинг Anthropic или OpenAI в конце месяца - и вижу сумму, которая либо смешит (пара долларов), либо пугает (счет за день вырос в 10 раз из-за бага в промпте). Стоимость токенов нейросети - это не абстракция из документации, а конкретная строчка в бюджете проекта, которую можно посчитать заранее с точностью до рубля. Ниже - реальные расчеты на задачах, с которыми я работал: Telegram-бот на aiogram, парсинг товаров с AI-классификацией, RAG-чатбот с базой знаний и автоматизация в n8n.
Из чего складывается стоимость токенов нейросети
Токен - не слово и не буква, а кусок текста, на который модель режет запрос при обработке. Английское слово обычно укладывается в один токен, русское - в полтора-два, потому что токенайзеры почти всех моделей обучены в основном на английском корпусе, а кириллица режется мельче. На практике один и тот же смысл на русском обходится на 30-60% дороже, чем на английском - проверял это на одинаковых промптах для бота техподдержки.
Цена складывается из двух частей, и они всегда разные: input-токены (то, что вы отправляете модели - системный промпт, историю диалога, контекст из базы знаний) и output-токены (то, что модель сгенерировала в ответ). Output почти всегда в 3-5 раз дороже input - генерация текста требует больше вычислений, чем его чтение. Поэтому длинный ответ модели бьет по бюджету сильнее, чем длинный вопрос пользователя.
Третья переменная, которую часто упускают - контекст, отправляемый заново с каждым запросом. Если бот при каждом сообщении подгружает документацию на 5 000 токенов, вы платите за эти 5 000 токенов на каждый вопрос пользователя, даже если девять из десяти вопросов однотипные.
Сколько стоят токены у разных моделей - сравниваю цены
Разброс цен между моделями - на порядок, и выбор модели решает бюджет сильнее, чем оптимизация промптов. Вот ориентировочные цены на конец 2025 - начало 2026 года (перед расчетом сверяйте актуальный прайс на сайте провайдера, тарифы меняются без предупреждения):
| Модель | Вход, $/1M токенов | Выход, $/1M токенов | Для чего беру |
|---|---|---|---|
| Claude Haiku | $0.80-1 | $4-5 | FAQ-боты, классификация, простая экстракция данных |
| Claude Sonnet | $3 | $15 | RAG, обработка документов, сложная логика в диалоге |
| Claude Opus | $15 | $75 | Сложный анализ, код, задачи с высокими требованиями к точности |
| GPT-4o-mini | $0.15 | $0.60 | Массовая обработка текста, где цена решает всё |
| GPT-4o | $2.50 | $10 | Универсальные задачи среднего уровня сложности |
В рублях по курсу около 95 ₽ за доллар разница между Haiku и Opus - это разница между 100 ₽ и 7000+ ₽ за миллион выходных токенов. Для бота, который отвечает на частые вопросы клиентов, я почти всегда беру самую дешевую модель линейки - она справляется с 90% задач поддержки, а разницу в качестве заметят разве что въедливые пользователи.
Бесплатный материал
🎁 Полезный скрипт в подарок
Подпишитесь на Telegram - пришлю готовый скрипт по этой теме.
Без спама. Отписка в 1 клик.
Реальные кейсы: считаю стоимость запросов на практике
Telegram-бот на aiogram с ответами на частые вопросы
Бот на aiogram с интеграцией Claude Haiku для ответов по FAQ интернет-магазина: системный промпт с описанием товаров и правил - 400 токенов, вопрос пользователя - в среднем 60 токенов, ответ - 150 токенов. При 500 диалогах в день это 230 000 input и 75 000 output токенов ежедневно, за месяц - 6,9 млн input и 2,25 млн output. По цене Haiku ($1 / $5 за 1M) выходит около 18 $ в месяц - чуть больше 1700 ₽. Дешевле, чем один час работы оператора поддержки.
Парсинг и классификация товаров на Python
Задача - прогнать 20 000 карточек товаров в месяц через модель для автоматической категоризации и генерации коротких описаний. Вход на карточку - около 350 токенов (описание плюс инструкция), выход - 15-20 токенов (только категория и теги). Итого 7 млн input и 300 000 output токенов в месяц. На GPT-4o-mini это чуть больше 1 $ в месяц - расходы на инфраструктуру самого парсера (прокси, ротация IP, серверы) в такой связке обычно на порядок выше, чем AI-часть.
RAG-чатбот с базой знаний компании
Здесь картина другая. При каждом запросе в промпт подгружаются релевантные куски документации - обычно 2500-3000 токенов контекста плюс вопрос и история диалога. При 1000 запросов в месяц на модели Sonnet это 3 млн input и 400 000 output токенов - около 15 $ (1400 ₽) в месяц. Без кэширования системного контекста цена растет линейно с трафиком: при 10 000 запросов в месяц счет уже под 150 $. Оптимизация промпта и кэш системной части здесь дают ощутимую экономию - разбираю это в следующем разделе.
Автоматизация обработки заявок в n8n
В n8n сценарий с извлечением структурированных данных из входящих писем и заявок (имя, услуга, бюджет, срочность - в JSON) на 5000 заявок в месяц при среднем размере письма 600 токенов на входе и 120 на выходе дает около 18 $ (1700 ₽) в месяц на модели Sonnet. Основная статья расходов здесь обычно не токены, а сама разработка сценария и его отладка на реальных письмах с их форматированием, подписями и цитатами.
Как заранее прикинуть бюджет на AI-интеграцию
Формула простая: (input-токены / 1 000 000 × цена входа) + (output-токены / 1 000 000 × цена выхода). Токены на входе я прикидываю по длине системного промпта и типичного запроса - для русского текста делю количество символов на 2,5, а не на 4, как для английского. Для выхода ориентируюсь на длину ответа, который реально нужен бизнесу: если ответ должен укладываться в 2-3 предложения, не давайте модели генерировать эссе - это прямые лишние деньги.
def estimate_cost(input_tokens, output_tokens, price_in, price_out):
return (input_tokens / 1_000_000 * price_in) + (output_tokens / 1_000_000 * price_out)
# Sonnet: $3 / $15 за 1M токенов, кейс с RAG-ботом на 1000 запросов в месяц
cost = estimate_cost(3_000_000, 400_000, 3, 15)
print(round(cost, 2)) # 15.0
В библиотеке готовых скриптов у меня лежит калькулятор для подсчета стоимости токенов - прогоняет тестовые промпты через официальный токенайзер и сразу считает цену для разных моделей. Это быстрее, чем оценивать на глаз, и точнее совпадает со счетом в конце месяца.
Как снизить расход токенов и не переплачивать
- Кэширование промптов (prompt caching) - если система читает один и тот же большой контекст (документацию, историю диалога, системные инструкции) на каждый запрос, кэш снижает цену повторного чтения этого блока в разы. На RAG-боте с частым трафиком это обычно сокращает счет в 2-4 раза.
- Выбор модели под задачу, а не самой мощной по умолчанию - для классификации, экстракции данных и коротких ответов Haiku или мини-модели справляются не хуже, а стоят в разы дешевле.
- Ограничение длины ответа через max_tokens и четкую инструкцию в промпте - модель, которой не сказали быть краткой, генерирует избыточные объяснения, а платите вы за каждый лишний токен.
- Обрезка истории диалога - вместо всей переписки с пользователем на каждый запрос храню только последние 3-5 сообщений плюс краткое резюме предыдущего контекста.
- Батчинг для несрочных задач - на batch-обработку провайдеры дают скидку до 50%, если результат не нужен мгновенно, например ночная классификация базы товаров.
На парсинге товаров с классификацией переход с Sonnet на Haiku снизил счет в 3 раза при той же задаче - разница в качестве на строго ограниченном списке категорий оказалась незаметна.
Частые ошибки, из-за которых счет за API удивляет
Чаще всего к росту счета приводит не сложность задачи, а невнимательность к деталям:
- Бесконечный цикл в агентной логике - бот повторно вызывает модель из-за ошибки в парсинге ответа, и один пользовательский запрос превращается в 10-15 обращений к API.
- Дублирование контекста - история диалога хранится и в промпте, и в отдельном RAG-запросе, в итоге модель получает один и тот же кусок текста дважды.
- Отладка на дорогой модели - удобно тестировать промпт на Opus, но если в проде будет работать Haiku, экономику нужно проверять тоже на ней: поведение и цена расходятся сильно.
- Отсутствие лимитов - без ограничения на длину ответа или число запросов на пользователя в час один недобросовестный пользователь может нагенерировать счет на несколько тысяч рублей за ночь.
Искусственный интеллект для бизнеса
AI / Claude API
от 50 000 ₽
Подробнее →Частые вопросы
Сколько токенов в одной странице текста?
Страница текста на русском языке (примерно 1800 символов) - это в среднем 700-900 токенов. Для сравнения, тот же объем на английском укладывается в 450-550 токенов - разница из-за особенностей токенизации кириллицы. При планировании бюджета для документов на русском закладывайте коэффициент минимум 1,5 к оценкам, которые встречаются в англоязычной документации провайдеров.
Почему счет за API вырос сам по себе, хотя нагрузка не менялась?
Обычно причина в контексте, который незаметно раздулся - история диалога накопилась, в RAG-поиск стало попадать больше чанков, или в промпт добавили лишний блок инструкций при последнем обновлении и забыли убрать. В таких случаях смотрю логи по количеству input-токенов за запрос в динамике: если оно растет от сообщения к сообщению внутри одного диалога, дело в накоплении истории.
Можно ли посчитать стоимость проекта до начала разработки?
Да, если известны примерные объемы - сколько запросов в день, какой размер контекста и ответа. На этапе оценки обычно закладываю тестовый прогон на 50-100 реальных примеров, это дает точную цифру вместо предположений и снимает риск сюрпризов в первый месяц работы после запуска.
Что дешевле - Claude или GPT?
Зависит от задачи, а не от бренда. На простой классификации и коротких ответах GPT-4o-mini часто выигрывает по цене у сравнимых моделей Anthropic. На задачах с длинным контекстом, где важна работа с большим объемом документов и точность в structured output, разница в цене между моделями часто перекрывается разницей в количестве повторных запросов из-за ошибок - дешевая модель, которая чаще ошибается, в итоге может обойтись дороже дорогой, но точной.