Коротко
Gemini берут за две вещи: контекст в 1M токенов у всех моделей линейки и самую низкую цену входа среди сопоставимых. Миллион токенов — это примерно 700 тысяч слов: договор на 300 страниц или десятки файлов кода уезжают в один запрос без нарезки на чанки.
Ключ у Google выпускается в AI Studio, но биллинг за пределами бесплатных квот требует зарубежной карты. Через altrouter — один ключ на всю линейку, оплата картой РФ, СБП или криптой.
Одна ловушка на входе: «flash» не значит «дешевле любого pro». gemini-3-pro дешевле, чем gemini-3.5-flash. Смотрите таблицу, а не название.
Что даёт Gemini API
Gemini API — программный доступ к моделям Google: HTTP-запрос с текстом на входе, ответ модели на выходе, оплата по токенам. Главная причина брать именно Gemini, а не что-то ещё, укладывается в одну цифру: контекст 1M токенов у всех моделей линейки. Это примерно 700 тысяч слов — вся кодовая база среднего сервиса, годовая переписка или несколько сотен PDF-страниц, отправленные в один запрос без всякой нарезки.
Вторая причина — цена. gemini-3.1-flash-lite стоит $0.22 за миллион входных токенов, и это делает осмысленными сценарии, которые на моделях верхнего сегмента просто не окупаются.
Ниже — как получить ключ, полная таблица цен, рабочий код и разбор, когда flash, а когда pro.
Как получить API-ключ Gemini
У Google ключ выпускается в AI Studio. Путь рабочий, но упирается в то же, во что упирается всё: биллинг за пределами бесплатных квот требует зарубежной карты, а сами квоты кончаются ровно тогда, когда проект перестаёт быть игрушкой.
Через altrouter — один ключ ко всем моделям Gemini сразу, с оплатой картой РФ, СБП или криптой, без VPN:
- Регистрация: /login?mode=signup — Google, Telegram или почта. Через @altrouter_bot — в один шаг.
- Создайте ключ в кабинете, он вида
ar-.... - Подтвердите Telegram — за это на баланс падает $1. Хватит на несколько сотен запросов к flash-lite, чтобы проверить всё до оплаты.
- Подставьте ключ и base URL в код.
Как передавать ключ — /docs/authentication/.
Про «gemini api free» и «бесплатные api gemini» — честно: у Google есть бесплатный тир с жёсткими лимитами, у нас бесплатного тарифа нет, есть стартовый $1 и цены ниже официальных. Токены стоят денег у всех.
Цены Gemini API
Цена — за 1M токенов, отдельно вход и выход. Контекст у всех моделей — 1M токенов.
| Модель | Вход, $/1M | Выход, $/1M | Контекст | Скидка |
|---|---|---|---|---|
| gemini-3.1-flash-lite | 0.22 | 1.35 | 1M | −10% |
| gemini-2.5-flash | 0.27 | 2.25 | 1M | −10% |
| gemini-3-flash | 0.45 | 2.70 | 1M | −10% |
| gemini-3.5-flash | 1.35 | 8.10 | 1M | −10% |
| gemini-3-pro | 0.75 | 5.25 | 1M | −15% |
| gemini-2.5-pro | 1.08 | 8.50 | 1M | −15% |
| gemini-3.1-pro | 1.46 | 10.20 | 1M | −15% |
Цены наши, они ниже официальных. Они меняются — актуальные всегда в каталоге /models/, карточка модели вроде /models/gemini-3-pro/ показывает текущие цифры и параметры.
Обратите внимание на неочевидное: gemini-3-pro ($0.75 на вход) дешевле, чем gemini-3.5-flash ($1.35). «Flash» не означает «дешевле любого pro» — это название линейки, а не гарантия цены. Сравнивайте по таблице, а не по интуиции.
Рабочий пример: Gemini API на Python
Модели Gemini у нас доступны через OpenAI-совместимый эндпоинт, так что подходит обычная библиотека openai — меняются только base_url и api_key:
from openai import OpenAI
client = OpenAI(
base_url="https://api.altrouter.ai/v1",
api_key="ar-...",
)
r = client.chat.completions.create(
model="gemini-3-pro",
messages=[{"role": "user", "content": "Привет"}],
)
print(r.choices[0].message.content)
Переключение на другую модель — одна строка: model="gemini-3.1-flash-lite". Ключ храните в переменной окружения.
Существующие эндпоинты: POST /v1/chat/completions (текст), POST /v1/images/generations (изображения), POST /v1/videos (видео, асинхронно), GET /v1/models (список моделей). Стриминг — /docs/streaming/, параметры — /docs/parameters/, ошибки — /docs/errors/.
Контекст 1M токенов: что с ним делать
Миллион токенов — не строчка в маркетинге, а другой способ строить приложение.
Обычно, когда документ не влезает в модель, вы городите RAG: режете текст на куски, считаете эмбеддинги, храните их в векторной базе, ищете релевантные фрагменты, собираете их обратно в промпт. Это работающая, но дорогая в поддержке конструкция, и она регулярно промахивается мимо нужного куска.
С контекстом в 1M токенов часть таких задач решается тем, что вы просто кладёте весь документ в запрос. Модель видит текст целиком — со всеми перекрёстными ссылками, которые нарезка на чанки разрывает.
Конкретные сценарии, где это выигрывает:
- Анализ большого документа целиком. Договор на 300 страниц, техзадание, годовой отчёт — вопросы по всему тексту сразу, без индексации.
- Работа с кодовой базой. Сложите десятки файлов в один запрос и спросите, где ломается инвариант. Модель увидит связи между модулями, а не отдельный файл.
- Длинные диалоги. История переписки на сотни сообщений едет в контексте целиком, без суммаризации предыдущих ходов.
- Пакетная обработка. Сто коротких текстов одним запросом вместо ста запросов — меньше накладных расходов и round-trip'ов.
Отрезвляющая арифметика: полный миллион входных токенов на gemini-3.1-flash-lite — это $0.22 за запрос, на gemini-3.1-pro — $1.46. Контекст большой, но не бесплатный, и вы платите за него на каждом вызове. Если один и тот же документ уходит в модель сто раз в день, дешевле один раз построить нормальный поиск по нему.
Своих эмбеддингов у нас нет — если вам нужен RAG, вектора считайте на стороне, а Gemini используйте для генерации ответа.
Flash-lite или pro: что выбирать
Ориентир простой: flash-линейка — на объём, pro — на сложность.
gemini-3.1-flash-lite ($0.22 / $1.35) — самая дешёвая модель в каталоге. Массовая обработка, где задача формализована: классификация, извлечение полей, теги, короткие ответы по шаблону, первичная фильтрация. Когда запросов десятки тысяч в день, цена входа перестаёт быть абстракцией: миллион запросов по 500 токенов — это $110 на flash-lite и $730 на gemini-3.1-pro.
gemini-2.5-flash ($0.27 / $2.25) и gemini-3-flash ($0.45 / $2.70) — чуть дороже, заметно способнее. Разумный дефолт для генерации текста, диалогов и суммаризации, где flash-lite уже начинает мазать.
gemini-3-pro ($0.75 / $5.25) — лучшее соотношение цены и глубины в линейке pro. Многошаговые рассуждения, сложная аналитика, работа с кодом.
gemini-2.5-pro ($1.08 / $8.50) и gemini-3.1-pro ($1.46 / $10.20) — верхний сегмент, когда задача действительно требует максимума и ошибка дороже токенов.
Метод выбора тот же, что и всегда: возьмите 20 реальных запросов, начните с flash-lite, поднимайтесь на ступень только там, где видите конкретные поломки. Прогнать сравнение можно в песочнице в кабинете, без написания кода.
Все модели Google — на /providers/google/. Там же не только текст:
- Изображения:
nano-bananaза $0.035,nano-banana-2за $0.071 иnano-banana-proза $0.121 за картинку. Отдельный эндпоинт — /docs/images/. - Видео:
veo-3.1за $2.55 за ролик иveo-3.1-fastза $0.98. Работает асинхронно — /docs/videos/.
Итог
Gemini API даёт две вещи, за которые его берут: контекст в миллион токенов и самые низкие цены на входе среди сопоставимых моделей. Один ключ ar-... открывает всю линейку — плюс модели Anthropic и OpenAI, если завтра понадобится сравнить. Актуальные цены — в /models/.
FAQ
Чем Gemini API отличается от других?
Двумя вещами: контекстом в 1 000 000 токенов у всех моделей линейки и самой низкой ценой входа среди сопоставимых. Миллион токенов — это примерно 700 тысяч слов, то есть договор на 300 страниц или десятки файлов кода уезжают в один запрос без нарезки на части.
Сколько стоит Gemini API?
За 1M токенов, вход и выход: Gemini 3.1 Flash Lite — $0.22 и $1.35, Gemini 2.5 Flash — $0.27 и $2.25, Gemini 3 Flash — $0.45 и $2.70, Gemini 3 Pro — $0.75 и $5.25, Gemini 2.5 Pro — $1.08 и $8.50, Gemini 3.1 Pro — $1.46 и $10.20.
Насколько дешевле flash-lite по сравнению с pro?
Существенно на объёме: миллион запросов по 500 токенов обойдётся примерно в $110 на gemini-3.1-flash-lite и в $730 на gemini-3.1-pro. Когда запросов десятки тысяч в день, цена входа перестаёт быть абстракцией.
Какую модель Gemini выбрать?
Flash Lite — для массовой обработки с формализованной задачей: классификация, извлечение полей, теги, первичная фильтрация. Flash — разумный дефолт для генерации текста и диалогов. Gemini 3 Pro — лучшее соотношение цены и глубины для рассуждений и кода. Старшие pro — когда ошибка дороже токенов.
Как получить API-ключ Gemini из России?
Прямая регистрация у Google упирается в поддерживаемые страны и оплату зарубежной картой. Через российский шлюз ключ выдаётся сразу, оплата рублями, а обращение идёт обычной библиотекой openai со сменой адреса — отдельный SDK не нужен.
Что делать с контекстом в миллион токенов?
Класть документ целиком вместо нарезки на части: договор, техзадание, кодовую базу среднего сервиса. Это убирает целый слой работы по разбиению и поиску нужного куска, но помните, что вход оплачивается в каждом запросе — длинный контекст в длинном диалоге дорожает линейно.