← Блог

Gemini API: ключ, цены и контекст 1M

· 8 минут чтения · обновлено

Коротко

Gemini берут за две вещи: контекст в 1M токенов у всех моделей линейки и самую низкую цену входа среди сопоставимых. Миллион токенов - это примерно 700 тысяч слов: договор на 300 страниц или десятки файлов кода уезжают в один запрос без нарезки на чанки.

Ключ у Google выпускается в AI Studio, но биллинг за пределами бесплатных квот требует зарубежной карты. Через altrouter - один ключ на всю линейку, оплата картой РФ, СБП или криптой.

Одна ловушка на входе: «flash» не значит «дешевле любого pro». gemini-3-pro дешевле, чем gemini-3.5-flash. Смотрите таблицу, а не название.

Что даёт Gemini API

Gemini API - программный доступ к моделям Google: HTTP-запрос с текстом на входе, ответ модели на выходе, оплата по токенам. Главная причина брать именно Gemini, а не что-то ещё, укладывается в одну цифру: контекст 1M токенов у всех моделей линейки. Это примерно 700 тысяч слов - вся кодовая база среднего сервиса, годовая переписка или несколько сотен PDF-страниц, отправленные в один запрос без всякой нарезки.

Вторая причина - цена. gemini-3.1-flash-lite стоит $0.22 за миллион входных токенов, и это делает осмысленными сценарии, которые на моделях верхнего сегмента просто не окупаются.

Ниже - как получить ключ, полная таблица цен, рабочий код и разбор, когда flash, а когда pro.

Как получить API-ключ Gemini

У Google ключ выпускается в AI Studio. Путь рабочий, но упирается в то же, во что упирается всё: биллинг за пределами бесплатных квот требует зарубежной карты, а сами квоты кончаются ровно тогда, когда проект перестаёт быть игрушкой.

Через altrouter - один ключ ко всем моделям Gemini сразу, с оплатой картой РФ, СБП или криптой, без VPN:

  1. Регистрация: /login?mode=signup - Google, Telegram или почта. Через @altrouter_bot - в один шаг.
  2. Создайте ключ в кабинете, он вида ar-....
  3. Подтвердите Telegram - за это на баланс падает $1. Хватит на несколько сотен запросов к flash-lite, чтобы проверить всё до оплаты.
  4. Подставьте ключ и base URL в код.

Как передавать ключ - /docs/authentication/.

Про «gemini api free» и «бесплатные api gemini» - честно: у Google есть бесплатный тир с жёсткими лимитами, у нас бесплатного тарифа нет, есть стартовый $1 и цены ниже официальных. Токены стоят денег у всех.

Цены Gemini API

Цена - за 1M токенов, отдельно вход и выход. Контекст у всех моделей - 1M токенов.

МодельВход, $/1MВыход, $/1MКонтекстСкидка
gemini-3.1-flash-lite0.221.351M−10%
gemini-2.5-flash0.272.251M−10%
gemini-3-flash0.452.701M−10%
gemini-3.5-flash1.358.101M−10%
gemini-3-pro0.755.251M−15%
gemini-2.5-pro1.088.501M−15%
gemini-3.1-pro1.4610.201M−15%

Цены наши, они ниже официальных. Они меняются - актуальные всегда в каталоге /models/, карточка модели вроде /models/gemini-3-pro/ показывает текущие цифры и параметры.

Обратите внимание на неочевидное: gemini-3-pro ($0.75 на вход) дешевле, чем gemini-3.5-flash ($1.35).

Столбчатая диаграмма, показывающая, что входной токен gemini-3-pro стоит дешевле gemini-3.5-flash.
Название линейки не гарантирует низкую цену: всегда сверяйтесь с таблицей тарифов перед выбором.
«Flash» не означает «дешевле любого pro» - это название линейки, а не гарантия цены. Сравнивайте по таблице, а не по интуиции.

Рабочий пример: Gemini API на Python

Модели Gemini у нас доступны через OpenAI-совместимый эндпоинт, так что подходит обычная библиотека openai - меняются только base_url и api_key:

from openai import OpenAI

client = OpenAI(
    base_url="https://api.altrouter.ai/v1",
    api_key="ar-...",
)

r = client.chat.completions.create(
    model="gemini-3-pro",
    messages=[{"role": "user", "content": "Привет"}],
)
print(r.choices[0].message.content)

Переключение на другую модель - одна строка: model="gemini-3.1-flash-lite". Ключ храните в переменной окружения.

Существующие эндпоинты: POST /v1/chat/completions (текст), POST /v1/images/generations (изображения), POST /v1/videos (видео, асинхронно), GET /v1/models (список моделей). Стриминг - /docs/streaming/, параметры - /docs/parameters/, ошибки - /docs/errors/.

Контекст 1M токенов: что с ним делать

Миллион токенов - не строчка в маркетинге, а другой способ строить приложение.

Обычно, когда документ не влезает в модель, вы городите RAG: режете текст на куски, считаете эмбеддинги, храните их в векторной базе, ищете релевантные фрагменты, собираете их обратно в промпт.

Схема сравнения: сложный процесс нарезки текста для RAG и прямая загрузка миллиона токенов в Gemini.
Большой контекст позволяет загружать документы целиком, избавляя от необходимости строить и поддерживать сложную архитектуру поиска.
Это работающая, но дорогая в поддержке конструкция, и она регулярно промахивается мимо нужного куска.

С контекстом в 1M токенов часть таких задач решается тем, что вы просто кладёте весь документ в запрос. Модель видит текст целиком - со всеми перекрёстными ссылками, которые нарезка на чанки разрывает.

Конкретные сценарии, где это выигрывает:

  • Анализ большого документа целиком. Договор на 300 страниц, техзадание, годовой отчёт - вопросы по всему тексту сразу, без индексации.
  • Работа с кодовой базой. Сложите десятки файлов в один запрос и спросите, где ломается инвариант. Модель увидит связи между модулями, а не отдельный файл.
  • Длинные диалоги. История переписки на сотни сообщений едет в контексте целиком, без суммаризации предыдущих ходов.
  • Пакетная обработка. Сто коротких текстов одним запросом вместо ста запросов - меньше накладных расходов и round-trip'ов.

Отрезвляющая арифметика: полный миллион входных токенов на gemini-3.1-flash-lite - это $0.22 за запрос, на gemini-3.1-pro - $1.46. Контекст большой, но не бесплатный, и вы платите за него на каждом вызове. Если один и тот же документ уходит в модель сто раз в день, дешевле один раз построить нормальный поиск по нему.

Своих эмбеддингов у нас нет - если вам нужен RAG, вектора считайте на стороне, а Gemini используйте для генерации ответа.

Flash-lite или pro: что выбирать

Ориентир простой: flash-линейка - на объём, pro - на сложность.

Визуальное разделение задач: линейка flash предназначена для массовой обработки, а pro — для сложных вычислений.
Выбирайте семейство моделей исходя из типа задачи: рутинные операции требуют скорости, а глубокая аналитика — продвинутой логики.

gemini-3.1-flash-lite ($0.22 / $1.35) - самая дешёвая модель в каталоге. Массовая обработка, где задача формализована: классификация, извлечение полей, теги, короткие ответы по шаблону, первичная фильтрация. Когда запросов десятки тысяч в день, цена входа перестаёт быть абстракцией: миллион запросов по 500 токенов - это $110 на flash-lite и $730 на gemini-3.1-pro.

gemini-2.5-flash ($0.27 / $2.25) и gemini-3-flash ($0.45 / $2.70) - чуть дороже, заметно способнее. Разумный дефолт для генерации текста, диалогов и суммаризации, где flash-lite уже начинает мазать.

gemini-3-pro ($0.75 / $5.25) - лучшее соотношение цены и глубины в линейке pro. Многошаговые рассуждения, сложная аналитика, работа с кодом.

gemini-2.5-pro ($1.08 / $8.50) и gemini-3.1-pro ($1.46 / $10.20) - верхний сегмент, когда задача действительно требует максимума и ошибка дороже токенов.

Метод выбора тот же, что и всегда: возьмите 20 реальных запросов, начните с flash-lite, поднимайтесь на ступень только там, где видите конкретные поломки. Прогнать сравнение можно в песочнице в кабинете, без написания кода.

Все модели Google - на /providers/google/. Там же не только текст:

  • Изображения: nano-banana за $0.035, nano-banana-2 за $0.071 и nano-banana-pro за $0.121 за картинку. Отдельный эндпоинт - /docs/images/.
  • Видео: veo-3.1 за $2.55 за ролик и veo-3.1-fast за $0.98. Работает асинхронно - /docs/videos/.

Итог

Gemini API даёт две вещи, за которые его берут: контекст в миллион токенов и самые низкие цены на входе среди сопоставимых моделей. Один ключ ar-... открывает всю линейку - плюс модели Anthropic и OpenAI, если завтра понадобится сравнить. Актуальные цены - в /models/.

FAQ

Чем Gemini API отличается от других?

Двумя вещами: контекстом в 1 000 000 токенов у всех моделей линейки и самой низкой ценой входа среди сопоставимых. Миллион токенов - это примерно 700 тысяч слов, то есть договор на 300 страниц или десятки файлов кода уезжают в один запрос без нарезки на части.

Сколько стоит Gemini API?

За 1M токенов, вход и выход: Gemini 3.1 Flash Lite - $0.22 и $1.35, Gemini 2.5 Flash - $0.27 и $2.25, Gemini 3 Flash - $0.45 и $2.70, Gemini 3 Pro - $0.75 и $5.25, Gemini 2.5 Pro - $1.08 и $8.50, Gemini 3.1 Pro - $1.46 и $10.20.

Насколько дешевле flash-lite по сравнению с pro?

Существенно на объёме: миллион запросов по 500 токенов обойдётся примерно в $110 на gemini-3.1-flash-lite и в $730 на gemini-3.1-pro. Когда запросов десятки тысяч в день, цена входа перестаёт быть абстракцией.

Какую модель Gemini выбрать?

Flash Lite - для массовой обработки с формализованной задачей: классификация, извлечение полей, теги, первичная фильтрация. Flash - разумный дефолт для генерации текста и диалогов. Gemini 3 Pro - лучшее соотношение цены и глубины для рассуждений и кода. Старшие pro - когда ошибка дороже токенов.

Как получить API-ключ Gemini из России?

Прямая регистрация у Google упирается в поддерживаемые страны и оплату зарубежной картой. Через российский шлюз ключ выдаётся сразу, оплата рублями, а обращение идёт обычной библиотекой openai со сменой адреса - отдельный SDK не нужен.

Что делать с контекстом в миллион токенов?

Класть документ целиком вместо нарезки на части: договор, техзадание, кодовую базу среднего сервиса. Это убирает целый слой работы по разбиению и поиску нужного куска, но помните, что вход оплачивается в каждом запросе - длинный контекст в длинном диалоге дорожает линейно.