Gemini 2.5 Flash

GoogleТекстИнструментыЗрение

Быстрая и недорогая Gemini для высоконагруженных сценариев, контекст 1M.

Наша цена
$0.27 / $2.25
вход / выход за 1M
Официальная
$0.30 / $2.50
−10% к официальной

Первый запрос

from openai import OpenAI

client = OpenAI(
    base_url="https://api.altrouter.ai/v1",
    api_key="ar-...",
)

resp = client.chat.completions.create(
    model="gemini-2.5-flash",
    messages=[{"role": "user", "content": "Hello!"}],
)
print(resp.choices[0].message.content)

Интерфейс OpenAI-совместимый: в готовом коде меняются только base_url, ключ и идентификатор модели — остальное трогать не нужно.

Gemini 2.5 Flash и соседи по цене

Gemini 2.5 Flash и ближайшие по цене модели: цены и параметры из каталога AltRouter AI
МодельВход / 1MВыход / 1MКонтекст
Gemini 3.5 Flash LiteGoogle$0.27$2.251.0MОткрыть
Gemini 2.5 Flashэта модельGoogle$0.27$2.251M
Claude Haiku 4.5Anthropic$0.77$4.00200KОткрыть
GPT-5.6 MiniOpenAI$0.85$5.10400KОткрыть
Grok 4.6xAI$1.70$5.10256KОткрыть

Цены и параметры — из того же каталога, что и прайс выше; это не бенчмарк, а сопоставимые условия оплаты.

Лимиты

Контекст — 1M токенов на запрос. В него входит всё, что вы отправили: системный промпт, история диалога и текущий вопрос вместе. Что не поместилось, модель не увидит — обрезать историю приходится на своей стороне, и платите вы ровно за то, что поместилось.

Длина ответа задаётся параметром max_tokens, потолок — 32 000 токенов за вызов. Ответ, упёршийся в этот потолок, приходит с finish_reason: "length": он оборван, но оплачен, поэтому на длинных генерациях значение стоит выставлять осознанно.

Поддерживается: вызов инструментов (tools), картинки на входе. Не поддерживается: режим рассуждений — запрос с ними вернёт ошибку, а не тихо проигнорирует их.

Подписки нет: деньги списываются за каждый успешный запрос по цене выше, а неудавшийся не оплачивается. Это уже цена со скидкой 10% от официальной цены вендора — официальная показана рядом зачёркнутой, чтобы её можно было сверить. Отдельного аккаунта у Google для этого не нужно: запрос уходит на api.altrouter.ai, а до вендора ходим мы.

Ограничение частоты общее для всех моделей и считается на ключ: 600 запросов в минуту по умолчанию, при превышении — 429 с заголовком retry-after: 60. Для отдельного ключа лимит и потолок трат за день, неделю, месяц или всё время настраиваются в кабинете.

Полные лимиты и кредиты

Когда выбирать Gemini 2.5 Flash, а когда соседнюю

Дешевле рядом — Gemini 3.5 Flash Lite: $0.27 за 1M входных токенов против $0.27 у Gemini 2.5 Flash. На одном и том же объёме счёт выходит в 1 раз меньше. Контекст у неё даже больше: 1.0M против 1M. Это разумный выбор там, где задача типовая и её много: разметка, классификация, короткие ответы по шаблону — то есть там, где качество упирается не в модель, а в промпт.

Дороже рядом — Claude Haiku 4.5: $0.77 за 1M входных токенов, то есть в 2,9 раза дороже. За переплату каталог обещает конкретное: режим рассуждений. Если ничего из этого задаче не нужно, переплата ни за что.

Проверять догадки здесь дешевле, чем рассуждать: сравнение выше — это цены и параметры, а не бенчмарк, и оно не скажет, какая модель лучше именно на вашем промпте. Переключение стоит одной строки — меняется идентификатор модели в запросе, base_url и ключ остаются те же, — так что прогнать обе на своих данных занимает минуты.

API

OpenAI-совместимый эндпоинт chat completions, со стримингом (SSE).

POST/v1/chat/completions
Параметры тела
modelstringrequired"gemini-2.5-flash"
Идентификатор модели.
messagesarrayrequired
История диалога: [{ role, content }].
streambooleandefault false
Стриминг ответа по SSE.
temperaturenumber0–2default 1
Случайность генерации: ниже - детерминированнее, выше - креативнее.
top_pnumber0–1default 1
Nucleus sampling - доля вероятностной массы.
max_tokensnumber1–32000
Максимум токенов в ответе.
seednumber0–2147483647
Seed для воспроизводимости.
frequency_penaltynumber-2–2
Штраф за повтор токенов по частоте.
presence_penaltynumber-2–2
Штраф за токены, которые уже встречались.
web_searchbooleandefault false
Поиск в интернете на стороне модели - ответы по свежим данным.

Структурированные поля (tools, response_format, stop и другие) - в полном справочнике параметров.

Ответ
idstring
Идентификатор ответа.
choicesarray
Варианты ответа. Каждый: index, message { role, content, reasoning_content, tool_calls }, finish_reason.
usageobject
Токены: prompt_tokens, completion_tokens, total_tokens.
Пример
cURLPythonJavaScriptJSON
curl https://api.altrouter.ai/v1/chat/completions \
  -H "Authorization: Bearer ar-..." \
  -H "Content-Type: application/json" \
  -d '{
  "model": "gemini-2.5-flash",
  "messages": [
    {
      "role": "user",
      "content": "Hello!"
    }
  ]
}'
Ошибки
400Некорректный запрос.
401Нет или неверный API-ключ.
402Недостаточно кредитов или исчерпан потолок трат ключа.
404Модель не найдена.
429Превышен лимит запросов.

Частые вопросы

Сколько стоит Gemini 2.5 Flash через API?
$0.27 за миллион входных токенов и $2.25 за миллион выходных. Это на 10% ниже официальной цены вендора — $0.30 и $2.50. Счёт ведётся в рублях, баланс пополняется картой РФ, через СБП или криптой — зарубежная карта не нужна.
Работает ли Gemini 2.5 Flash из России?
Да. Запрос уходит на api.altrouter.ai, а до Google ходим мы, а не вы. Отдельный аккаунт у вендора при этом не нужен.
Как подключить Gemini 2.5 Flash?
Интерфейс OpenAI-совместимый: в вашем коде меняются base_url на https://api.altrouter.ai/v1 и ключ, а модель указывается идентификатором gemini-2.5-flash. Остальной код трогать не нужно.
Справочник API
Какой контекст у Gemini 2.5 Flash?
1 000 000 токенов на запрос — это весь ваш ввод вместе с историей диалога и системным промптом. Что не влезло, модель не увидит, и платите вы за то, что влезло.
Можно ли попробовать Gemini 2.5 Flash бесплатно?
Отдельного бесплатного тарифа нет. За подтверждённый Telegram на баланс начисляется $1 — один раз на человека, этого хватает, чтобы прогнать модель на своей задаче до того, как платить.

Ещё от Google