Gemini 2.5 Flash
Быстрая и недорогая Gemini для высоконагруженных сценариев, контекст 1M.
Первый запрос
from openai import OpenAI
client = OpenAI(
base_url="https://api.altrouter.ai/v1",
api_key="ar-...",
)
resp = client.chat.completions.create(
model="gemini-2.5-flash",
messages=[{"role": "user", "content": "Hello!"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.altrouter.ai/v1",
apiKey: process.env.ALTROUTER_API_KEY, // ar-...
});
const resp = await client.chat.completions.create({
model: "gemini-2.5-flash",
messages: [{ role: "user", content: "Hello!" }],
});
console.log(resp.choices[0].message.content);curl https://api.altrouter.ai/v1/chat/completions \
-H "Authorization: Bearer ar-..." \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-2.5-flash",
"messages": [
{
"role": "user",
"content": "Hello!"
}
]
}'Интерфейс OpenAI-совместимый: в готовом коде меняются только base_url, ключ и идентификатор модели — остальное трогать не нужно.
Gemini 2.5 Flash и соседи по цене
| Модель | Вход / 1M | Выход / 1M | Контекст | |
|---|---|---|---|---|
| Gemini 3.5 Flash LiteGoogle | $0.27 | $2.25 | 1.0M | Открыть |
| Gemini 2.5 Flashэта модельGoogle | $0.27 | $2.25 | 1M | |
| Claude Haiku 4.5Anthropic | $0.77 | $4.00 | 200K | Открыть |
| GPT-5.6 MiniOpenAI | $0.85 | $5.10 | 400K | Открыть |
| Grok 4.6xAI | $1.70 | $5.10 | 256K | Открыть |
Цены и параметры — из того же каталога, что и прайс выше; это не бенчмарк, а сопоставимые условия оплаты.
Лимиты
Контекст — 1M токенов на запрос. В него входит всё, что вы отправили: системный промпт, история диалога и текущий вопрос вместе. Что не поместилось, модель не увидит — обрезать историю приходится на своей стороне, и платите вы ровно за то, что поместилось.
Длина ответа задаётся параметром max_tokens, потолок — 32 000 токенов за вызов. Ответ, упёршийся в этот потолок, приходит с finish_reason: "length": он оборван, но оплачен, поэтому на длинных генерациях значение стоит выставлять осознанно.
Поддерживается: вызов инструментов (tools), картинки на входе. Не поддерживается: режим рассуждений — запрос с ними вернёт ошибку, а не тихо проигнорирует их.
Подписки нет: деньги списываются за каждый успешный запрос по цене выше, а неудавшийся не оплачивается. Это уже цена со скидкой 10% от официальной цены вендора — официальная показана рядом зачёркнутой, чтобы её можно было сверить. Отдельного аккаунта у Google для этого не нужно: запрос уходит на api.altrouter.ai, а до вендора ходим мы.
Ограничение частоты общее для всех моделей и считается на ключ: 600 запросов в минуту по умолчанию, при превышении — 429 с заголовком retry-after: 60. Для отдельного ключа лимит и потолок трат за день, неделю, месяц или всё время настраиваются в кабинете.
Когда выбирать Gemini 2.5 Flash, а когда соседнюю
Дешевле рядом — Gemini 3.5 Flash Lite: $0.27 за 1M входных токенов против $0.27 у Gemini 2.5 Flash. На одном и том же объёме счёт выходит в 1 раз меньше. Контекст у неё даже больше: 1.0M против 1M. Это разумный выбор там, где задача типовая и её много: разметка, классификация, короткие ответы по шаблону — то есть там, где качество упирается не в модель, а в промпт.
Дороже рядом — Claude Haiku 4.5: $0.77 за 1M входных токенов, то есть в 2,9 раза дороже. За переплату каталог обещает конкретное: режим рассуждений. Если ничего из этого задаче не нужно, переплата ни за что.
Проверять догадки здесь дешевле, чем рассуждать: сравнение выше — это цены и параметры, а не бенчмарк, и оно не скажет, какая модель лучше именно на вашем промпте. Переключение стоит одной строки — меняется идентификатор модели в запросе, base_url и ключ остаются те же, — так что прогнать обе на своих данных занимает минуты.
OpenAI-совместимый эндпоинт chat completions, со стримингом (SSE).
/v1/chat/completionsСтруктурированные поля (tools, response_format, stop и другие) - в полном справочнике параметров.