Gemini 3.5 Flash
Новейшая быстрая Gemini 3.5 - сильные рассуждения при низкой задержке.
Первый запрос
from openai import OpenAI
client = OpenAI(
base_url="https://api.altrouter.ai/v1",
api_key="ar-...",
)
resp = client.chat.completions.create(
model="gemini-3.5-flash",
messages=[{"role": "user", "content": "Hello!"}],
)
print(resp.choices[0].message.content)import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.altrouter.ai/v1",
apiKey: process.env.ALTROUTER_API_KEY, // ar-...
});
const resp = await client.chat.completions.create({
model: "gemini-3.5-flash",
messages: [{ role: "user", content: "Hello!" }],
});
console.log(resp.choices[0].message.content);curl https://api.altrouter.ai/v1/chat/completions \
-H "Authorization: Bearer ar-..." \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.5-flash",
"messages": [
{
"role": "user",
"content": "Hello!"
}
]
}'Интерфейс OpenAI-совместимый: в готовом коде меняются только base_url, ключ и идентификатор модели — остальное трогать не нужно.
Gemini 3.5 Flash и соседи по цене
| Модель | Вход / 1M | Выход / 1M | Контекст | |
|---|---|---|---|---|
| GPT-5.6 MiniOpenAI | $0.85 | $5.10 | 400K | Открыть |
| Grok 4.6xAI | $1.70 | $5.10 | 256K | Открыть |
| Gemini 3.5 Flashэта модельGoogle | $1.35 | $8.10 | 1M | |
| Claude Sonnet 5Anthropic | $1.69 | $8.50 | 200K | Открыть |
| Gemini 3.1 ProGoogle | $1.46 | $10.20 | 1M | Открыть |
Цены и параметры — из того же каталога, что и прайс выше; это не бенчмарк, а сопоставимые условия оплаты.
Лимиты
Контекст — 1M токенов на запрос. В него входит всё, что вы отправили: системный промпт, история диалога и текущий вопрос вместе. Что не поместилось, модель не увидит — обрезать историю приходится на своей стороне, и платите вы ровно за то, что поместилось.
Длина ответа задаётся параметром max_tokens, потолок — 32 000 токенов за вызов. Ответ, упёршийся в этот потолок, приходит с finish_reason: "length": он оборван, но оплачен, поэтому на длинных генерациях значение стоит выставлять осознанно.
Поддерживается: режим рассуждений, вызов инструментов (tools), картинки на входе.
Подписки нет: деньги списываются за каждый успешный запрос по цене выше, а неудавшийся не оплачивается. Это уже цена со скидкой 10% от официальной цены вендора — официальная показана рядом зачёркнутой, чтобы её можно было сверить. Отдельного аккаунта у Google для этого не нужно: запрос уходит на api.altrouter.ai, а до вендора ходим мы.
Ограничение частоты общее для всех моделей и считается на ключ: 600 запросов в минуту по умолчанию, при превышении — 429 с заголовком retry-after: 60. Для отдельного ключа лимит и потолок трат за день, неделю, месяц или всё время настраиваются в кабинете.
Когда выбирать Gemini 3.5 Flash, а когда соседнюю
Дешевле рядом — Grok 4.6: $1.70 за 1M входных токенов против $1.35 у Gemini 3.5 Flash. Контекст меньше: 256K против 1M — длинные документы придётся резать. Это разумный выбор там, где задача типовая и её много: разметка, классификация, короткие ответы по шаблону — то есть там, где качество упирается не в модель, а в промпт.
Дороже рядом — Claude Sonnet 5: $1.69 за 1M входных токенов, то есть в 1,3 раза дороже. По параметрам каталога — тот же набор возможностей и тот же порядок контекста, поэтому переплата оправдана только если Gemini 3.5 Flash на вашей задаче не справляется.
Проверять догадки здесь дешевле, чем рассуждать: сравнение выше — это цены и параметры, а не бенчмарк, и оно не скажет, какая модель лучше именно на вашем промпте. Переключение стоит одной строки — меняется идентификатор модели в запросе, base_url и ключ остаются те же, — так что прогнать обе на своих данных занимает минуты.
OpenAI-совместимый эндпоинт chat completions, со стримингом (SSE).
/v1/chat/completionsСтруктурированные поля (tools, response_format, stop и другие) - в полном справочнике параметров.