Gemini 3.5 Flash Lite

GoogleТекстИнструментыЗрение

Gemini 3.5 Flash Lite: самая дешёвая и быстрая Gemini нового поколения для массовых задач, контекст 1M.

Наша цена
$0.27 / $2.25
вход / выход за 1M
Официальная
$0.30 / $2.50
10% к официальной

Первый запрос

from openai import OpenAI

client = OpenAI(
    base_url="https://api.altrouter.ai/v1",
    api_key="ar-...",
)

resp = client.chat.completions.create(
    model="gemini-3.5-flash-lite",
    messages=[{"role": "user", "content": "Hello!"}],
)
print(resp.choices[0].message.content)

Интерфейс OpenAI-совместимый: в готовом коде меняются только base_url, ключ и идентификатор модели — остальное трогать не нужно.

Gemini 3.5 Flash Lite и соседи по цене

Gemini 3.5 Flash Lite и ближайшие по цене модели: цены и параметры из каталога AltRouter AI
МодельВход / 1MВыход / 1MКонтекст
Gemini 3.5 Flash Liteэта модельGoogle$0.27$2.251.0M
Gemini 3.8 FlashGoogle$0.64$3.191MОткрыть
Claude Haiku 4.5Anthropic$0.77$4.00200KОткрыть
GPT-5.6 MiniOpenAI$0.85$5.10400KОткрыть
Grok 4.6xAI$1.70$5.10256KОткрыть

Цены и параметры — из того же каталога, что и прайс выше; это не бенчмарк, а сопоставимые условия оплаты.

Лимиты

Контекст — 1.0M токенов на запрос. В него входит всё, что вы отправили: системный промпт, история диалога и текущий вопрос вместе. Что не поместилось, модель не увидит — обрезать историю приходится на своей стороне, и платите вы ровно за то, что поместилось.

Длина ответа задаётся параметром max_tokens, потолок — 32 000 токенов за вызов. Ответ, упёршийся в этот потолок, приходит с finish_reason: "length": он оборван, но оплачен, поэтому на длинных генерациях значение стоит выставлять осознанно.

Поддерживается: вызов инструментов (tools), картинки на входе. Не поддерживается: режим рассуждений — запрос с ними вернёт ошибку, а не тихо проигнорирует их.

Подписки нет: деньги списываются за каждый успешный запрос по цене выше, а неудавшийся не оплачивается. Это уже цена со скидкой 10% от официальной цены вендора — официальная показана рядом зачёркнутой, чтобы её можно было сверить. Отдельного аккаунта у Google для этого не нужно, и VPN тоже: запрос уходит на api.altrouter.ai, а до вендора ходим мы.

Ограничение частоты общее для всех моделей и считается на ключ: 600 запросов в минуту по умолчанию, при превышении — 429 с заголовком retry-after: 60. Для отдельного ключа лимит и потолок трат за день, неделю, месяц или всё время настраиваются в кабинете.

Полные лимиты и кредиты

Когда выбирать Gemini 3.5 Flash Lite, а когда соседнюю

Дороже рядом — Gemini 3.8 Flash: $0.64 за 1M входных токенов, то есть в 2,4 раза дороже. За переплату каталог обещает конкретное: режим рассуждений. Если ничего из этого задаче не нужно, переплата ни за что.

Проверять догадки здесь дешевле, чем рассуждать: сравнение выше — это цены и параметры, а не бенчмарк, и оно не скажет, какая модель лучше именно на вашем промпте. Переключение стоит одной строки — меняется идентификатор модели в запросе, base_url и ключ остаются те же, — так что прогнать обе на своих данных занимает минуты.

API

OpenAI-совместимый эндпоинт chat completions, со стримингом (SSE).

POST/v1/chat/completions
Параметры тела
modelstringrequired"gemini-3.5-flash-lite"
Идентификатор модели.
messagesarrayrequired
История диалога: [{ role, content }].
streambooleandefault false
Стриминг ответа по SSE.
temperaturenumber0–2default 1
Случайность генерации: ниже - детерминированнее, выше - креативнее.
top_pnumber0–1default 1
Nucleus sampling - доля вероятностной массы.
max_tokensnumber1–32000
Максимум токенов в ответе.
seednumber0–2147483647
Seed для воспроизводимости.
frequency_penaltynumber-2–2
Штраф за повтор токенов по частоте.
presence_penaltynumber-2–2
Штраф за токены, которые уже встречались.

Структурированные поля (tools, response_format, stop и другие) - в полном справочнике параметров.

Ответ
idstring
Идентификатор ответа.
choicesarray
Варианты ответа. Каждый: index, message { role, content, reasoning_content, tool_calls }, finish_reason.
usageobject
Токены: prompt_tokens, completion_tokens, total_tokens.
Пример
cURLPythonJavaScriptJSON
curl https://api.altrouter.ai/v1/chat/completions \
  -H "Authorization: Bearer ar-..." \
  -H "Content-Type: application/json" \
  -d '{
  "model": "gemini-3.5-flash-lite",
  "messages": [
    {
      "role": "user",
      "content": "Hello!"
    }
  ]
}'
Ошибки
400Некорректный запрос.
401Нет или неверный API-ключ.
402Недостаточно кредитов или исчерпан потолок трат ключа.
404Модель не найдена.
429Превышен лимит запросов.

Частые вопросы

Сколько стоит Gemini 3.5 Flash Lite через API?
$0.27 за миллион входных токенов и $2.25 за миллион выходных. Это на 10% ниже официальной цены вендора — $0.30 и $2.50. Счёт ведётся в рублях, баланс пополняется картой РФ, через СБП или криптой — зарубежная карта не нужна.
Работает ли Gemini 3.5 Flash Lite из России?
Да, и без VPN. Запрос уходит на api.altrouter.ai, а до Google ходим мы, а не вы. Отдельный аккаунт у вендора при этом не нужен.
Как подключить Gemini 3.5 Flash Lite?
Интерфейс OpenAI-совместимый: в вашем коде меняются base_url на https://api.altrouter.ai/v1 и ключ, а модель указывается идентификатором gemini-3.5-flash-lite. Остальной код трогать не нужно.
Справочник API
Какой контекст у Gemini 3.5 Flash Lite?
1 048 576 токенов на запрос — это весь ваш ввод вместе с историей диалога и системным промптом. Что не влезло, модель не увидит, и платите вы за то, что влезло.
Можно ли попробовать Gemini 3.5 Flash Lite бесплатно?
Отдельного бесплатного тарифа нет. За подтверждённый Telegram на баланс начисляется $1 — один раз на человека, этого хватает, чтобы прогнать модель на своей задаче до того, как платить.

Ещё от Google