Коротко
Цена API считается не за запрос и не за месяц, а за расход: текст - за токены, изображения - за штуку, видео - за секунду или за ролик.
Разброс между моделями больше, чем ожидают почти все. Миллион входных токенов стоит от $0.22 у Gemini 3.1 Flash Lite до $6 у Claude Fable 5 - разница почти в 27 раз при том, что обе модели «умеют в текст». Картинка обойдётся от $0.0175 до $0.22. Секунда видео - от $0.0375.
Отсюда главный практический вывод: выбор модели - это и есть выбор цены. Одна и та же задача на разных строчках таблицы стоит $30 в месяц или $290. Ниже - все цены и три расчёта, чтобы прикинуть свой счёт до того, как платить.
Как устроена цена
Три разных счётчика, и путать их дорого.
Текст - за токены, отдельно вход и выход. Токен - это примерно 3-4 символа русского текста; страница А4 - около 700-900 токенов. Вход - всё, что вы отправили: системный промпт, история диалога, приложенный документ. Выход - то, что модель сгенерировала. Выход дороже входа в 5-6 раз у большинства моделей, и именно он обычно и делает счёт.
Изображения - за готовую картинку, независимо от длины промпта. У части моделей есть отдельная цена за 4K.
Видео - за секунду ролика, кроме Veo 3.1, который тарифицируется за ролик целиком. Подробный разбор с расчётами - в статье сколько стоит видео нейросетью.
Цены ниже - наши, они ниже официальных на 10-50% в зависимости от модели. Источник правды - каталог /models/, а не эта статья: цены меняются, таблица стареет.
Текстовые модели: цена за 1M токенов
24 модели, четыре провайдера. Внутри каждой линейки цена растёт вместе с «мощностью», и почти всегда есть дешёвая строчка, которой хватает для рутины.
| Модель | Вход, $/1M | Выход, $/1M | Контекст |
|---|---|---|---|
| gemini-3.1-flash-lite | 0.22 | 1.35 | 1M |
| gemini-2.5-flash | 0.27 | 2.25 | 1M |
| gemini-3-flash | 0.45 | 2.70 | 1M |
| gemini-3-pro | 0.75 | 5.25 | 1M |
| gemini-2.5-pro | 1.08 | 8.50 | 1M |
| gemini-3.5-flash | 1.35 | 8.10 | 1M |
| gemini-3.1-pro | 1.46 | 10.20 | 1M |
Самые дешёвые входные токены на рынке и контекст 1M у всей линейки. Если задача - «прочитать много и ответить коротко», деньги почти всегда здесь.
OpenAI
| Модель | Вход, $/1M | Выход, $/1M | Контекст |
|---|---|---|---|
| gpt-5.6-mini | 0.85 | 5.10 | 400K |
| gpt-5.2 | 1.40 | 11.20 | 400K |
| gpt-5.4 | 1.49 | 12.75 | 400K |
| gpt-5.6 | 2.13 | 12.75 | 400K |
| gpt-5.5 | 4.16 | 25.50 | 400K |
| gpt-5.6-pro | 4.25 | 25.50 | 400K |
Обратите внимание на выход: у старших моделей он в 25 раз дороже входа у Flash Lite. Разбор линейки и расчёты - в статье сколько стоит ChatGPT API.
Anthropic
| Модель | Вход, $/1M | Выход, $/1M | Контекст |
|---|---|---|---|
| claude-haiku-4-5 | 0.77 | 4.00 | 200K |
| claude-sonnet-5 | 1.69 | 8.50 | 200K |
| claude-sonnet-4-5 | 2.68 | 13.50 | 200K |
| claude-sonnet-4-6 | 2.68 | 13.50 | 200K |
| claude-opus-4-5 | 3.74 | 18.75 | 200K |
| claude-opus-4-6 | 3.99 | 20.00 | 200K |
| claude-opus-4-7 | 3.99 | 20.00 | 200K |
| claude-opus-4-8 | 4.50 | 22.50 | 200K |
| claude-fable-5 | 6.00 | 30.00 | 200K |
Самая дорогая линейка в каталоге, но текущий Sonnet 5 стоит дешевле предыдущих Sonnet - при обновлении поколения имеет смысл пересчитать бюджет.
xAI
| Модель | Вход, $/1M | Выход, $/1M | Контекст |
|---|---|---|---|
| grok-4.3 | 1.06 | 2.13 | 256K |
| grok-4.5 | 1.70 | 5.10 | 256K |
У Grok 4.3 нетипичная пропорция: выход всего вдвое дороже входа, а не в шесть раз. На задачах с длинными ответами это заметно дешевле аналогов.
Изображения: цена за картинку
| Модель | Провайдер | За картинку | 4K |
|---|---|---|---|
| qwen-image | Alibaba | $0.0175 | - |
| flux-2-pro | Black Forest | $0.030 | - |
| grok-imagine | xAI | $0.030 | - |
| seedream-v4 | ByteDance | $0.030 | $0.030 |
| wan-2.7 | Alibaba | $0.030 | - |
| nano-banana | $0.035 | - | |
| nano-banana-fast | $0.035 | - | |
| seedream-5-lite | ByteDance | $0.035 | $0.035 |
| gpt-image-2 | OpenAI | $0.037 | $0.080 |
| seedream-4.5 | ByteDance | $0.040 | $0.040 |
| seedream-5-pro | ByteDance | $0.045 | - |
| nano-banana-2 | $0.071 | $0.106 | |
| nano-banana-pro | $0.121 | $0.216 |
Тысяча картинок на Qwen Image - $17.50, на Nano Banana Pro в 4K - $216. Разница в 12 раз, и это тот случай, когда стоит прогнать десяток тестовых генераций, прежде чем выбирать по названию.
Видео: за секунду или за ролик
| Модель | Провайдер | Цена |
|---|---|---|
| hailuo-2.3 | MiniMax | $0.0375 / сек |
| kling-2.6 | Kling | $0.069 / сек |
| kling-3.0 | Kling | $0.0875 / сек |
| wan-2.7-video | Alibaba | $0.092 / сек |
| seedance-2.0 | ByteDance | $0.246 / сек |
| veo-3.1-fast | $0.975 / ролик | |
| veo-3.1 | $2.55 / ролик |
Пятисекундный ролик: $0.19 на Hailuo, $1.23 на Seedance 2.0. Veo считается иначе - фиксированная цена за генерацию.
Сколько это выходит в месяц
Абстрактные $/1M ни о чём не говорят, пока не подставлены объёмы. Три типовых сценария на реальных цифрах.
Бот поддержки: 1 500 запросов в день
Вход 1 200 токенов (системный промпт, вопрос, кусок базы знаний), выход 300 токенов.
| Модель | Цена запроса | В месяц |
|---|---|---|
| gemini-3.1-flash-lite | $0.00068 | ~$30 |
| gpt-5.6-mini | $0.00255 | ~$115 |
| claude-sonnet-5 | $0.00458 | ~$206 |
| gpt-5.6 | $0.00638 | ~$287 |
Одна и та же задача - от 2 400 до 23 000 ₽ в месяц при курсе 80 ₽/$. Разница не в качестве ответа на 90% обращений, а в том, какую строчку выбрали при старте.
Массовая обработка: 10 000 карточек товара
Вход 700 токенов, выход 250 токенов, разово.
gemini-3.1-flash-lite- $4.92gpt-5.6-mini- $18.70gpt-5.6- $46.79claude-fable-5- $117.00
Разбор документов: 200 PDF по 40 000 токенов
Вход 40 000 токенов, выход 800.
gemini-3-flash- $4.03gemini-3-pro- $6.84claude-sonnet-5- $14.88gpt-5.6- $19.08
Здесь виден эффект длинного входа: выход почти не влияет на счёт, платите вы за чтение. Поэтому на документах выигрывают модели с дешёвым входом, а не «самые умные».
Что не входит в цену
Честно о том, чего в этих цифрах нет.
Скидки за повторный контекст у нас нет. Некоторые вендоры удешевляют повторно отправленный префикс промпта. Мы такое не тарифицируем отдельно - считайте полную цену входа в каждом запросе. Для длинных системных промптов это заметная разница, и это аргумент не раздувать промпт.
Рассуждения оплачиваются как выход. У моделей с размышлением часть выходных токенов уходит на внутренний рассуждающий блок, который вы в ответе не видите. Ответ на три строки может стоить как ответ на страницу.
Неудачные запросы тоже стоят денег. Если модель ответила не то, что нужно, токены уже израсходованы. Отладку промпта дешевле делать на mini-модели.
Эмбеддингов, TTS, распознавания речи и batch-обработки у нас нет. Если ваш сценарий на них завязан - это к вендору напрямую, никакая таблица цен тут не поможет.
Как реально урезать счёт - отдельный разбор в статье как снизить расходы на токены. Там же про max_tokens: если параметр не передан, мы подставляем 4096, но полагаться на это как на настройку не стоит.
Как посчитать свой счёт точно
Таблица даёт порядок величины, точную цифру даёт замер. Сделайте один реальный запрос и посмотрите usage:
from openai import OpenAI
client = OpenAI(
base_url="https://api.altrouter.ai/v1",
api_key="ar-...",
)
r = client.chat.completions.create(
model="gemini-3.1-flash-lite",
messages=[{"role": "user", "content": "Твой реальный промпт целиком"}],
)
print(r.usage)
usage покажет фактические входные и выходные токены. Умножьте на цену модели, умножьте на свой дневной объём - это и есть бюджет, без прикидок. Расход по каждому ключу с разбивкой по моделям виден в логах кабинета.
Проверить всё это можно до оплаты: за подтверждённый Telegram на баланс начисляется $1 - на замер хватает с большим запасом.
FAQ
Сколько стоит API нейросети за 1 000 запросов?
Зависит от модели и длины запроса. При типичном обращении в 1 200 входных и 300 выходных токенов тысяча запросов стоит $0.68 на Gemini 3.1 Flash Lite, $2.55 на GPT-5.6 Mini и $6.38 на GPT-5.6. Разница между самой дешёвой и самой дорогой моделью каталога - примерно десятикратная.
Какая модель самая дешёвая?
По входным токенам - Gemini 3.1 Flash Lite: $0.22 за 1M входа и $1.35 за 1M выхода при контексте 1M. Среди генераторов изображений дешевле всех Qwen Image - $0.0175 за картинку. В видео - Hailuo 2.3, $0.0375 за секунду.
Почему выходные токены дороже входных?
Генерация ответа требует больше вычислений, чем чтение запроса, и вендоры закладывают это в тариф. Разница обычно пяти-шестикратная, поэтому ограничение длины ответа через max_tokens экономит больше, чем сокращение промпта.
Считаются ли токены на русском языке иначе?
Да, русский текст расходует примерно вдвое больше токенов, чем английский той же длины, потому что кириллица режется на более мелкие куски. При расчёте бюджета для русскоязычного продукта закладывайте запас - прикидка «страница = 700 токенов» ближе к правде, чем формальные 4 символа на токен.
Можно ли платить за API из России рублями?
Да, если работать через российский шлюз: баланс пополняется картой, через СБП или криптой, а к коду добавляются два поля - адрес сервиса и ключ. Прямая оплата зарубежному вендору упирается в иностранную карту на этапе биллинга.
Сколько стоит попробовать?
Один тестовый запрос к дешёвой модели стоит доли цента. За подтверждённый Telegram начисляется $1 стартового баланса - этого хватает на сотни запросов к моделям вроде Gemini Flash Lite или GPT-5.6 Mini, чтобы измерить собственное потребление до первого пополнения.