Первый отзыв уходит в gemini-3.5-flash-lite, модель возвращает правильные поля, но оборачивает их в markdown-блок ```json — и json.loads падает на первой же обратной кавычке. Так выглядит типичный первый запрос к Gemini 3.5 Flash-Lite, выбранной по логике «цифра новее, а Lite должно быть дешевле».
Модель доступна в altrouter по OpenAI-совместимому API с оплатой картой РФ, СБП или криптой. За подтверждённый Telegram один раз начисляется $1 на пробу, регистрация бесплатная, а цена у нас на 10% ниже официальной цены Google.
Дальше — шесть действий, которые начинающий разработчик обычно делает первым делом, и факты, из-за которых часть этих действий лучше отменить до запуска массовой обработки отзывов.
Gemini 3.5 Flash Lite: что это за модель
У Google и в нашем каталоге модель называется одинаково — gemini-3.5-flash-lite (страница модели). В каталоге OpenRouter она появилась 21.07.2026.
Google описывает модель как «A cost-efficient model, optimized for high-volume agentic tasks, translation, and simple data processing». OpenRouter называет её высокоэффективной моделью Google с улучшенными агентными возможностями, подходящей для субагентов с узкими задачами внутри сложных многоагентных процессов.
Контекст модели — 1 048 576 токенов. Контекст — всё, что модель видит за один запрос: вопрос, инструкции и переданную историю. Максимальный выход по данным OpenRouter составляет 65 536 токенов, а в нашем каталоге max_tokens можно установить до 32 000.
Официальная цена Google, снятая 22.09.2026, составляет $0,30 за 1 млн входных токенов и $2,50 за 1 млн выходных. В altrouter на ту же дату — $0,27 и $2,25 соответственно, то есть скидка 10% от официальной цены вендора.
Для сравнения, у Gemini 3.1 Flash-Lite (страница модели) цена Google — $0,25 за вход и $1,50 за выход. У 3.5 вход дороже на 20%, а выход — на 67%. В строке цены Google отдельно указано, что выход включает thinking tokens, если модель их использует.
Шесть вещей, которые вы сделаете первым делом
1. Взять 3.5, потому что она новее, а Lite значит самая дешёвая.
Название подталкивает к простой покупке: новая версия должна быть сильнее, а Lite — дешевле. Но на задаче извлечения полей из отзыва 22.09.2026 обе модели вернули один и тот же JSON слово в слово.
Запрос содержал тональность, товар и проблему покупателя. У gemini-3.5-flash-lite он занял 8,9 с, а у gemini-3.1-flash-lite — 7,0 с. Стоимость одного запроса составила примерно $0,000144 против $0,000095, а обработка 10 000 отзывов — около $1,44 против $0,95.

Вердикт: для простого извлечения и классификации зря, потому что на нашем запросе результат одинаковый, а 3.5 дороже в полтора раза.
3.5 имеет смысл проверять там, где Google обещает улучшения: в агентных задачах и сценариях с субагентами, которые выполняют отдельные действия с инструментами.
2. Поверить response_format: json_object и ждать чистый JSON.
Параметр response_format задаёт ожидаемый формат ответа. В запросе мы передали {"type":"json_object"}, но обе Flash-Lite вернули результат внутри markdown-обёртки:
```json
{
"sentiment": "negative",
"product": "наушники",
"problem": "левый наушник не заряжается, поддержка не отвечает третий день"
}
```
Технически внутри находится нужный объект. Практически строка начинается с трёх обратных кавычек и слова json, поэтому прямой вызов json.loads(text) завершается ошибкой разбора. На той же задаче 3.1 Flash-Lite вернула такую же обёртку.

Вердикт: зря, потому что json_object не отменяет проверку строки; срезайте markdown-обёртку перед json.loads и проверяйте схему.
Подробнее о таком сценарии — в статье «Модель вернула не JSON: как получать структурированный ответ».
3. Не ставить max_tokens, потому что ответ и так короткий.
max_tokens — потолок длины ответа, который задаёте вы. Если модель упрётся в этот предел, она может остановиться до завершения результата.
В запросе с извлечением трёх полей мы поставили max_tokens: 300. Ответ занял 47 токенов и завершился с finish_reason: stop, то есть модель закончила ответ сама.
В отдельном прогоне 22.09.2026 параметр не передавали. В этом случае altrouter подставляет 4096 токенов. Ответ остался тем же, те же 47 токенов, время — 13,8 с (один вызов, время зависит от нагрузки).
На коротком извлечении разницы в деньгах нет. Разница появится там, где модель решит ответить длинно: без своего потолка вы узнаете об этом только из счёта.
Вердикт: зря, потому что автоматическая подстановка 4096 — страховка от случайно длинного ответа, а не настройка под вашу задачу; для извлечения полей хватило бы 300.
4. Считать цену по длине своего вопроса.
Токены — кусочки текста, которые API считает для входа и выхода. Счёт приходит не по количеству символов в вашей строке, а по полям usage в ответе.
В нашем замере приветствие состояло из одного слова: hi. При этом API посчитало 87 входных токенов и 9 выходных. Около 80 входных токенов пришлись на служебную прибавку на маршруте к Gemini.
Это наш минус. В деньгах такая прибавка составляет примерно $0,00002 на запрос, поэтому на длинных запросах она почти незаметна. На миллионе коротких запросов она сложится примерно в $22 — сумма уже заметная, если вы классифицируете короткие фразы по одной.
Отсюда практический приём: короткие тексты выгоднее отправлять пачкой в одном запросе, чем по одному. Служебная часть тогда оплачивается один раз на пачку, а не на каждую фразу.
Вердикт: зря, потому что длина строки не показывает реальный счёт; смотрите usage.prompt_tokens и usage.completion_tokens.
В примере с отзывом было 142 входных и 47 выходных токенов. По нашим ценам один такой запрос к 3.5 Flash-Lite стоил примерно $0,000144.
5. Отправлять весь миллион токенов, раз он помещается в контекст.
Контекст модели составляет 1 048 576 токенов, но большой лимит не превращает повторную отправку истории в бесплатную операцию. Каждый запрос передаёт контекст заново.
Если отправить полный контекст в 1 048 576 токенов по нашей цене входа $0,27 за 1 млн, один запрос обойдётся примерно в $0,28. Для разового анализа большого документа это может быть нормальным расчётом.
В диалоге ситуация другая. Если вы пересылаете всю историю в каждом сообщении, одна и та же информация снова попадает в счёт. Приёмы сокращения таких расходов собраны в статье «Как снизить расходы на токены: 10 приёмов с расчётами».
Вердикт: нормально, если вы один раз разбираете большой документ; зря, если отправляете полную историю в каждом сообщении.
6. Ждать, что Lite будет рассуждать над сложным вопросом.
Токены рассуждений — внутренний черновик «думающей» модели. В ответе их не видно, но они входят в оплачиваемый выход.
В наших запросах 22.09.2026 скрытых токенов рассуждений не было: total_tokens равнялся сумме видимых входных и выходных токенов. Параметра reasoning_effort для этой модели в нашем каталоге нет.
Для сравнения, в замере из статьи «Как оплатить Gemini из России: подписка, API, Enterprise» у gemini-3.8-flash и gemini-3.1-pro на похожей задаче было примерно 1 200–1 360 общих токенов при около 140 видимых токенах. Там разница приходилась на рассуждения.
Вердикт: зря, потому что наши прогоны не показали скрытого этапа рассуждений; для такой задачи берите модель, которая рассуждает, и учитывайте её выход в счёте.
Как правильно: пять настроек перед первым запросом
Перед массовой обработкой отзывов проверьте пять вещей:
- Укажите точный идентификатор
gemini-3.5-flash-lite. - Поставьте
response_format: {"type": "json_object"}, но всё равно очистите markdown-обёртку. - Задайте
max_tokensпо задаче, например 300 для трёх полей. - Сохраняйте
usage.prompt_tokensиusage.completion_tokens. - Сравните результат с
gemini-3.1-flash-lite, если задача простая и чувствительна к цене.
Последний пункт важнее, чем кажется. Прогоните 20–30 своих реальных отзывов через обе модели и сравните поля. Если ответы совпадают, как в нашем замере, разница в счёте — это полтора раза за один и тот же результат. Полную таблицу цен линейки Gemini мы собрали в статье «Сколько стоит Gemini API».

Подключение использует библиотеку openai и OpenAI-совместимый адрес:
import json, re
from openai import OpenAI
client = OpenAI(api_key="ar-...", base_url="https://api.altrouter.ai/v1")
r = client.chat.completions.create(
model="gemini-3.5-flash-lite",
messages=[{"role": "user", "content": "Из отзыва извлеки JSON с полями sentiment, product, problem. Отзыв: ..."}],
response_format={"type": "json_object"},
max_tokens=300,
)
text = r.choices[0].message.content
text = re.sub(r"^```(?:json)?\s*|\s*```$", "", text.strip())
data = json.loads(text)
print(data, r.usage.prompt_tokens, r.usage.completion_tokens)
Последовательность такая: зарегистрироваться, получить ключ в кабинете, подтвердить Telegram (один раз начисляется $1 на тесты), установить библиотеку openai, указать https://api.altrouter.ai/v1 и выбрать модель. Оплата идёт по факту токенов, без подписки, картой РФ, СБП или криптой.
Что вы не получите через API-шлюз
Это модель, а не приложение Gemini. Истории в аккаунте Google и функций приложения здесь нет.
Формат запросов — OpenAI, а не нативный формат Google. Метода generateContent и пакета google-genai у нас нет.
Бесплатного тарифа нет: есть стартовый $1, дальше — оплата за токены. Бесплатный тир у Google есть, но России нет в списке стран Gemini API, а запросы бесплатного тира Google использует для улучшения своих продуктов. Время ответа в наших замерах составило 8,9–13,8 с у 3.5 Flash-Lite и 7,0 с у 3.1 Flash-Lite. Для фоновой пакетной обработки это может быть несущественно, но для чата в реальном времени это наш минус.
FAQ
Сколько стоит Gemini 3.5 Flash Lite по API?
Google: $0,30 за 1 млн входных токенов и $2,50 за 1 млн выходных по данным на 22.09.2026. В altrouter — $0,27 и $2,25, то есть на 10% ниже официальной цены вендора. Извлечение полей из одного отзыва в нашем замере стоило примерно $0,000144.
Чем Gemini 3.5 Flash Lite отличается от 3.1 Flash Lite?
У 3.5 выход дороже на 67%, а вход — на 20%. По описанию Google, 3.5 нацелена на агентные задачи, но на нашей задаче извлечения полей обе модели ответили слово в слово.
Какой контекст у Gemini 3.5 Flash Lite?
Контекст составляет 1 048 576 токенов. Максимальный выход по данным OpenRouter — 65 536 токенов, а в нашем каталоге max_tokens можно поставить до 32 000.
Почему Gemini возвращает JSON в блоке markdown?
Даже с response_format: json_object обе Flash-Lite в нашем замере обернули JSON в markdown-блок. Перед разбором нужно срезать обёртку, а затем передать очищенную строку в json.loads.
Можно ли пользоваться Gemini 3.5 Flash Lite из России?
России нет в списке стран Gemini API. Через altrouter модель доступна по OpenAI-совместимому API с оплатой картой РФ, СБП или криптой.