altrouter.ai
← Блог

Gemini API: ключ, цены и контекст 1M

· 8 минут чтения · обновлено

Коротко

Gemini берут за две вещи: контекст в 1M токенов у всех моделей линейки и самую низкую цену входа среди сопоставимых. Миллион токенов — это примерно 700 тысяч слов: договор на 300 страниц или десятки файлов кода уезжают в один запрос без нарезки на чанки.

Ключ у Google выпускается в AI Studio, но биллинг за пределами бесплатных квот требует зарубежной карты. Через altrouter — один ключ на всю линейку, оплата картой РФ, СБП или криптой.

Одна ловушка на входе: «flash» не значит «дешевле любого pro». gemini-3-pro дешевле, чем gemini-3.5-flash. Смотрите таблицу, а не название.

Что даёт Gemini API

Gemini API — программный доступ к моделям Google: HTTP-запрос с текстом на входе, ответ модели на выходе, оплата по токенам. Главная причина брать именно Gemini, а не что-то ещё, укладывается в одну цифру: контекст 1M токенов у всех моделей линейки. Это примерно 700 тысяч слов — вся кодовая база среднего сервиса, годовая переписка или несколько сотен PDF-страниц, отправленные в один запрос без всякой нарезки.

Вторая причина — цена. gemini-3.1-flash-lite стоит $0.22 за миллион входных токенов, и это делает осмысленными сценарии, которые на моделях верхнего сегмента просто не окупаются.

Ниже — как получить ключ, полная таблица цен, рабочий код и разбор, когда flash, а когда pro.

Как получить API-ключ Gemini

У Google ключ выпускается в AI Studio. Путь рабочий, но упирается в то же, во что упирается всё: биллинг за пределами бесплатных квот требует зарубежной карты, а сами квоты кончаются ровно тогда, когда проект перестаёт быть игрушкой.

Через altrouter — один ключ ко всем моделям Gemini сразу, с оплатой картой РФ, СБП или криптой, без VPN:

  1. Регистрация: /login?mode=signup — Google, Telegram или почта. Через @altrouter_bot — в один шаг.
  2. Создайте ключ в кабинете, он вида ar-....
  3. Подтвердите Telegram — за это на баланс падает $1. Хватит на несколько сотен запросов к flash-lite, чтобы проверить всё до оплаты.
  4. Подставьте ключ и base URL в код.

Как передавать ключ — /docs/authentication/.

Про «gemini api free» и «бесплатные api gemini» — честно: у Google есть бесплатный тир с жёсткими лимитами, у нас бесплатного тарифа нет, есть стартовый $1 и цены ниже официальных. Токены стоят денег у всех.

Цены Gemini API

Цена — за 1M токенов, отдельно вход и выход. Контекст у всех моделей — 1M токенов.

МодельВход, $/1MВыход, $/1MКонтекстСкидка
gemini-3.1-flash-lite0.221.351M−10%
gemini-2.5-flash0.272.251M−10%
gemini-3-flash0.452.701M−10%
gemini-3.5-flash1.358.101M−10%
gemini-3-pro0.755.251M−15%
gemini-2.5-pro1.088.501M−15%
gemini-3.1-pro1.4610.201M−15%

Цены наши, они ниже официальных. Они меняются — актуальные всегда в каталоге /models/, карточка модели вроде /models/gemini-3-pro/ показывает текущие цифры и параметры.

Обратите внимание на неочевидное: gemini-3-pro ($0.75 на вход) дешевле, чем gemini-3.5-flash ($1.35). «Flash» не означает «дешевле любого pro» — это название линейки, а не гарантия цены. Сравнивайте по таблице, а не по интуиции.

Рабочий пример: Gemini API на Python

Модели Gemini у нас доступны через OpenAI-совместимый эндпоинт, так что подходит обычная библиотека openai — меняются только base_url и api_key:

from openai import OpenAI

client = OpenAI(
    base_url="https://api.altrouter.ai/v1",
    api_key="ar-...",
)

r = client.chat.completions.create(
    model="gemini-3-pro",
    messages=[{"role": "user", "content": "Привет"}],
)
print(r.choices[0].message.content)

Переключение на другую модель — одна строка: model="gemini-3.1-flash-lite". Ключ храните в переменной окружения.

Существующие эндпоинты: POST /v1/chat/completions (текст), POST /v1/images/generations (изображения), POST /v1/videos (видео, асинхронно), GET /v1/models (список моделей). Стриминг — /docs/streaming/, параметры — /docs/parameters/, ошибки — /docs/errors/.

Контекст 1M токенов: что с ним делать

Миллион токенов — не строчка в маркетинге, а другой способ строить приложение.

Обычно, когда документ не влезает в модель, вы городите RAG: режете текст на куски, считаете эмбеддинги, храните их в векторной базе, ищете релевантные фрагменты, собираете их обратно в промпт. Это работающая, но дорогая в поддержке конструкция, и она регулярно промахивается мимо нужного куска.

С контекстом в 1M токенов часть таких задач решается тем, что вы просто кладёте весь документ в запрос. Модель видит текст целиком — со всеми перекрёстными ссылками, которые нарезка на чанки разрывает.

Конкретные сценарии, где это выигрывает:

  • Анализ большого документа целиком. Договор на 300 страниц, техзадание, годовой отчёт — вопросы по всему тексту сразу, без индексации.
  • Работа с кодовой базой. Сложите десятки файлов в один запрос и спросите, где ломается инвариант. Модель увидит связи между модулями, а не отдельный файл.
  • Длинные диалоги. История переписки на сотни сообщений едет в контексте целиком, без суммаризации предыдущих ходов.
  • Пакетная обработка. Сто коротких текстов одним запросом вместо ста запросов — меньше накладных расходов и round-trip'ов.

Отрезвляющая арифметика: полный миллион входных токенов на gemini-3.1-flash-lite — это $0.22 за запрос, на gemini-3.1-pro — $1.46. Контекст большой, но не бесплатный, и вы платите за него на каждом вызове. Если один и тот же документ уходит в модель сто раз в день, дешевле один раз построить нормальный поиск по нему.

Своих эмбеддингов у нас нет — если вам нужен RAG, вектора считайте на стороне, а Gemini используйте для генерации ответа.

Flash-lite или pro: что выбирать

Ориентир простой: flash-линейка — на объём, pro — на сложность.

gemini-3.1-flash-lite ($0.22 / $1.35) — самая дешёвая модель в каталоге. Массовая обработка, где задача формализована: классификация, извлечение полей, теги, короткие ответы по шаблону, первичная фильтрация. Когда запросов десятки тысяч в день, цена входа перестаёт быть абстракцией: миллион запросов по 500 токенов — это $110 на flash-lite и $730 на gemini-3.1-pro.

gemini-2.5-flash ($0.27 / $2.25) и gemini-3-flash ($0.45 / $2.70) — чуть дороже, заметно способнее. Разумный дефолт для генерации текста, диалогов и суммаризации, где flash-lite уже начинает мазать.

gemini-3-pro ($0.75 / $5.25) — лучшее соотношение цены и глубины в линейке pro. Многошаговые рассуждения, сложная аналитика, работа с кодом.

gemini-2.5-pro ($1.08 / $8.50) и gemini-3.1-pro ($1.46 / $10.20) — верхний сегмент, когда задача действительно требует максимума и ошибка дороже токенов.

Метод выбора тот же, что и всегда: возьмите 20 реальных запросов, начните с flash-lite, поднимайтесь на ступень только там, где видите конкретные поломки. Прогнать сравнение можно в песочнице в кабинете, без написания кода.

Все модели Google — на /providers/google/. Там же не только текст:

  • Изображения: nano-banana за $0.035, nano-banana-2 за $0.071 и nano-banana-pro за $0.121 за картинку. Отдельный эндпоинт — /docs/images/.
  • Видео: veo-3.1 за $2.55 за ролик и veo-3.1-fast за $0.98. Работает асинхронно — /docs/videos/.

Итог

Gemini API даёт две вещи, за которые его берут: контекст в миллион токенов и самые низкие цены на входе среди сопоставимых моделей. Один ключ ar-... открывает всю линейку — плюс модели Anthropic и OpenAI, если завтра понадобится сравнить. Актуальные цены — в /models/.

FAQ

Чем Gemini API отличается от других?

Двумя вещами: контекстом в 1 000 000 токенов у всех моделей линейки и самой низкой ценой входа среди сопоставимых. Миллион токенов — это примерно 700 тысяч слов, то есть договор на 300 страниц или десятки файлов кода уезжают в один запрос без нарезки на части.

Сколько стоит Gemini API?

За 1M токенов, вход и выход: Gemini 3.1 Flash Lite — $0.22 и $1.35, Gemini 2.5 Flash — $0.27 и $2.25, Gemini 3 Flash — $0.45 и $2.70, Gemini 3 Pro — $0.75 и $5.25, Gemini 2.5 Pro — $1.08 и $8.50, Gemini 3.1 Pro — $1.46 и $10.20.

Насколько дешевле flash-lite по сравнению с pro?

Существенно на объёме: миллион запросов по 500 токенов обойдётся примерно в $110 на gemini-3.1-flash-lite и в $730 на gemini-3.1-pro. Когда запросов десятки тысяч в день, цена входа перестаёт быть абстракцией.

Какую модель Gemini выбрать?

Flash Lite — для массовой обработки с формализованной задачей: классификация, извлечение полей, теги, первичная фильтрация. Flash — разумный дефолт для генерации текста и диалогов. Gemini 3 Pro — лучшее соотношение цены и глубины для рассуждений и кода. Старшие pro — когда ошибка дороже токенов.

Как получить API-ключ Gemini из России?

Прямая регистрация у Google упирается в поддерживаемые страны и оплату зарубежной картой. Через российский шлюз ключ выдаётся сразу, оплата рублями, а обращение идёт обычной библиотекой openai со сменой адреса — отдельный SDK не нужен.

Что делать с контекстом в миллион токенов?

Класть документ целиком вместо нарезки на части: договор, техзадание, кодовую базу среднего сервиса. Это убирает целый слой работы по разбиению и поиску нужного куска, но помните, что вход оплачивается в каждом запросе — длинный контекст в длинном диалоге дорожает линейно.