← Блог

Gemini 3.5 Flash Lite по API: 6 ошибок первого запроса

· 9 минут чтения

Первый отзыв уходит в gemini-3.5-flash-lite, модель возвращает правильные поля, но оборачивает их в markdown-блок ```json — и json.loads падает на первой же обратной кавычке. Так выглядит типичный первый запрос к Gemini 3.5 Flash-Lite, выбранной по логике «цифра новее, а Lite должно быть дешевле».

Модель доступна в altrouter по OpenAI-совместимому API с оплатой картой РФ, СБП или криптой. За подтверждённый Telegram один раз начисляется $1 на пробу, регистрация бесплатная, а цена у нас на 10% ниже официальной цены Google.

Дальше — шесть действий, которые начинающий разработчик обычно делает первым делом, и факты, из-за которых часть этих действий лучше отменить до запуска массовой обработки отзывов.

Gemini 3.5 Flash Lite: что это за модель

У Google и в нашем каталоге модель называется одинаково — gemini-3.5-flash-lite (страница модели). В каталоге OpenRouter она появилась 21.07.2026.

Google описывает модель как «A cost-efficient model, optimized for high-volume agentic tasks, translation, and simple data processing». OpenRouter называет её высокоэффективной моделью Google с улучшенными агентными возможностями, подходящей для субагентов с узкими задачами внутри сложных многоагентных процессов.

Контекст модели — 1 048 576 токенов. Контекст — всё, что модель видит за один запрос: вопрос, инструкции и переданную историю. Максимальный выход по данным OpenRouter составляет 65 536 токенов, а в нашем каталоге max_tokens можно установить до 32 000.

Официальная цена Google, снятая 22.09.2026, составляет $0,30 за 1 млн входных токенов и $2,50 за 1 млн выходных. В altrouter на ту же дату — $0,27 и $2,25 соответственно, то есть скидка 10% от официальной цены вендора.

Для сравнения, у Gemini 3.1 Flash-Lite (страница модели) цена Google — $0,25 за вход и $1,50 за выход. У 3.5 вход дороже на 20%, а выход — на 67%. В строке цены Google отдельно указано, что выход включает thinking tokens, если модель их использует.

Шесть вещей, которые вы сделаете первым делом

1. Взять 3.5, потому что она новее, а Lite значит самая дешёвая.

Название подталкивает к простой покупке: новая версия должна быть сильнее, а Lite — дешевле. Но на задаче извлечения полей из отзыва 22.09.2026 обе модели вернули один и тот же JSON слово в слово.

Запрос содержал тональность, товар и проблему покупателя. У gemini-3.5-flash-lite он занял 8,9 с, а у gemini-3.1-flash-lite — 7,0 с. Стоимость одного запроса составила примерно $0,000144 против $0,000095, а обработка 10 000 отзывов — около $1,44 против $0,95.

Сравнение официальных цен Google: Gemini 3.1 Flash-Lite $0,25 и $1,50, Gemini 3.5 Flash-Lite $0,30 и $2,50
Новее не значит дешевле: выход у 3.5 Flash-Lite на 67% дороже, чем у 3.1

Вердикт: для простого извлечения и классификации зря, потому что на нашем запросе результат одинаковый, а 3.5 дороже в полтора раза.

3.5 имеет смысл проверять там, где Google обещает улучшения: в агентных задачах и сценариях с субагентами, которые выполняют отдельные действия с инструментами.

2. Поверить response_format: json_object и ждать чистый JSON.

Параметр response_format задаёт ожидаемый формат ответа. В запросе мы передали {"type":"json_object"}, но обе Flash-Lite вернули результат внутри markdown-обёртки:

```json
{
  "sentiment": "negative",
  "product": "наушники",
  "problem": "левый наушник не заряжается, поддержка не отвечает третий день"
}
```

Технически внутри находится нужный объект. Практически строка начинается с трёх обратных кавычек и слова json, поэтому прямой вызов json.loads(text) завершается ошибкой разбора. На той же задаче 3.1 Flash-Lite вернула такую же обёртку.

Схема: ответ модели в обёртке json ломает json.loads, после очистки получается словарь
json_object не гарантирует чистую строку: три обратные кавычки ломают разбор

Вердикт: зря, потому что json_object не отменяет проверку строки; срезайте markdown-обёртку перед json.loads и проверяйте схему.

Подробнее о таком сценарии — в статье «Модель вернула не JSON: как получать структурированный ответ».

3. Не ставить max_tokens, потому что ответ и так короткий.

max_tokens — потолок длины ответа, который задаёте вы. Если модель упрётся в этот предел, она может остановиться до завершения результата.

В запросе с извлечением трёх полей мы поставили max_tokens: 300. Ответ занял 47 токенов и завершился с finish_reason: stop, то есть модель закончила ответ сама.

В отдельном прогоне 22.09.2026 параметр не передавали. В этом случае altrouter подставляет 4096 токенов. Ответ остался тем же, те же 47 токенов, время — 13,8 с (один вызов, время зависит от нагрузки).

На коротком извлечении разницы в деньгах нет. Разница появится там, где модель решит ответить длинно: без своего потолка вы узнаете об этом только из счёта.

Вердикт: зря, потому что автоматическая подстановка 4096 — страховка от случайно длинного ответа, а не настройка под вашу задачу; для извлечения полей хватило бы 300.

4. Считать цену по длине своего вопроса.

Токены — кусочки текста, которые API считает для входа и выхода. Счёт приходит не по количеству символов в вашей строке, а по полям usage в ответе.

В нашем замере приветствие состояло из одного слова: hi. При этом API посчитало 87 входных токенов и 9 выходных. Около 80 входных токенов пришлись на служебную прибавку на маршруте к Gemini.

Это наш минус. В деньгах такая прибавка составляет примерно $0,00002 на запрос, поэтому на длинных запросах она почти незаметна. На миллионе коротких запросов она сложится примерно в $22 — сумма уже заметная, если вы классифицируете короткие фразы по одной.

Отсюда практический приём: короткие тексты выгоднее отправлять пачкой в одном запросе, чем по одному. Служебная часть тогда оплачивается один раз на пачку, а не на каждую фразу.

Вердикт: зря, потому что длина строки не показывает реальный счёт; смотрите usage.prompt_tokens и usage.completion_tokens.

В примере с отзывом было 142 входных и 47 выходных токенов. По нашим ценам один такой запрос к 3.5 Flash-Lite стоил примерно $0,000144.

5. Отправлять весь миллион токенов, раз он помещается в контекст.

Контекст модели составляет 1 048 576 токенов, но большой лимит не превращает повторную отправку истории в бесплатную операцию. Каждый запрос передаёт контекст заново.

Если отправить полный контекст в 1 048 576 токенов по нашей цене входа $0,27 за 1 млн, один запрос обойдётся примерно в $0,28. Для разового анализа большого документа это может быть нормальным расчётом.

В диалоге ситуация другая. Если вы пересылаете всю историю в каждом сообщении, одна и та же информация снова попадает в счёт. Приёмы сокращения таких расходов собраны в статье «Как снизить расходы на токены: 10 приёмов с расчётами».

Вердикт: нормально, если вы один раз разбираете большой документ; зря, если отправляете полную историю в каждом сообщении.

6. Ждать, что Lite будет рассуждать над сложным вопросом.

Токены рассуждений — внутренний черновик «думающей» модели. В ответе их не видно, но они входят в оплачиваемый выход.

В наших запросах 22.09.2026 скрытых токенов рассуждений не было: total_tokens равнялся сумме видимых входных и выходных токенов. Параметра reasoning_effort для этой модели в нашем каталоге нет.

Для сравнения, в замере из статьи «Как оплатить Gemini из России: подписка, API, Enterprise» у gemini-3.8-flash и gemini-3.1-pro на похожей задаче было примерно 1 200–1 360 общих токенов при около 140 видимых токенах. Там разница приходилась на рассуждения.

Вердикт: зря, потому что наши прогоны не показали скрытого этапа рассуждений; для такой задачи берите модель, которая рассуждает, и учитывайте её выход в счёте.

Как правильно: пять настроек перед первым запросом

Перед массовой обработкой отзывов проверьте пять вещей:

  1. Укажите точный идентификатор gemini-3.5-flash-lite.
  2. Поставьте response_format: {"type": "json_object"}, но всё равно очистите markdown-обёртку.
  3. Задайте max_tokens по задаче, например 300 для трёх полей.
  4. Сохраняйте usage.prompt_tokens и usage.completion_tokens.
  5. Сравните результат с gemini-3.1-flash-lite, если задача простая и чувствительна к цене.

Последний пункт важнее, чем кажется. Прогоните 20–30 своих реальных отзывов через обе модели и сравните поля. Если ответы совпадают, как в нашем замере, разница в счёте — это полтора раза за один и тот же результат. Полную таблицу цен линейки Gemini мы собрали в статье «Сколько стоит Gemini API».

Чек-лист из пяти пунктов перед первым запросом к Gemini 3.5 Flash Lite
Пять настроек, которые экономят больше, чем выбор модели

Подключение использует библиотеку openai и OpenAI-совместимый адрес:

import json, re
from openai import OpenAI

client = OpenAI(api_key="ar-...", base_url="https://api.altrouter.ai/v1")

r = client.chat.completions.create(
    model="gemini-3.5-flash-lite",
    messages=[{"role": "user", "content": "Из отзыва извлеки JSON с полями sentiment, product, problem. Отзыв: ..."}],
    response_format={"type": "json_object"},
    max_tokens=300,
)
text = r.choices[0].message.content
text = re.sub(r"^```(?:json)?\s*|\s*```$", "", text.strip())
data = json.loads(text)
print(data, r.usage.prompt_tokens, r.usage.completion_tokens)

Последовательность такая: зарегистрироваться, получить ключ в кабинете, подтвердить Telegram (один раз начисляется $1 на тесты), установить библиотеку openai, указать https://api.altrouter.ai/v1 и выбрать модель. Оплата идёт по факту токенов, без подписки, картой РФ, СБП или криптой.

Что вы не получите через API-шлюз

Это модель, а не приложение Gemini. Истории в аккаунте Google и функций приложения здесь нет.

Формат запросов — OpenAI, а не нативный формат Google. Метода generateContent и пакета google-genai у нас нет.

Бесплатного тарифа нет: есть стартовый $1, дальше — оплата за токены. Бесплатный тир у Google есть, но России нет в списке стран Gemini API, а запросы бесплатного тира Google использует для улучшения своих продуктов. Время ответа в наших замерах составило 8,9–13,8 с у 3.5 Flash-Lite и 7,0 с у 3.1 Flash-Lite. Для фоновой пакетной обработки это может быть несущественно, но для чата в реальном времени это наш минус.

FAQ

Сколько стоит Gemini 3.5 Flash Lite по API?

Google: $0,30 за 1 млн входных токенов и $2,50 за 1 млн выходных по данным на 22.09.2026. В altrouter — $0,27 и $2,25, то есть на 10% ниже официальной цены вендора. Извлечение полей из одного отзыва в нашем замере стоило примерно $0,000144.

Чем Gemini 3.5 Flash Lite отличается от 3.1 Flash Lite?

У 3.5 выход дороже на 67%, а вход — на 20%. По описанию Google, 3.5 нацелена на агентные задачи, но на нашей задаче извлечения полей обе модели ответили слово в слово.

Какой контекст у Gemini 3.5 Flash Lite?

Контекст составляет 1 048 576 токенов. Максимальный выход по данным OpenRouter — 65 536 токенов, а в нашем каталоге max_tokens можно поставить до 32 000.

Почему Gemini возвращает JSON в блоке markdown?

Даже с response_format: json_object обе Flash-Lite в нашем замере обернули JSON в markdown-блок. Перед разбором нужно срезать обёртку, а затем передать очищенную строку в json.loads.

Можно ли пользоваться Gemini 3.5 Flash Lite из России?

России нет в списке стран Gemini API. Через altrouter модель доступна по OpenAI-совместимому API с оплатой картой РФ, СБП или криптой.