← Блог

ИИ-агент сжигает бюджет из-за растущей истории переписки

· 7 минут чтения

Код отрабатывает без ошибок, задача успешно решается за десять шагов. В логах всё выглядит красиво: запрос ушёл, нужный инструмент вызвался, ответ вернулся, сессия закрылась. Проблема обнаруживается на следующий день, когда вы открываете панель биллинга в кабинете провайдера. Оказывается, эти десять шагов обошлись не как десять обычных текстовых запросов к API, а в несколько раз дороже. Бюджет сгорает на глазах, хотя количество пользовательских задач остаётся прежним. Это не скрытая комиссия платформы и не сбой биллинга. Это фундаментальная механика работы контекстного окна при цикличных вызовах, которую легко упустить при проектировании.

Как устроен цикл вызова инструментов

Обычный вызов языковой модели работает строго линейно. Вы отправили текст, провайдер вернул ответ, соединение завершилось. Это разовая операция без продолжения. ИИ-агент работает совершенно иначе. Это не какая-то специальная версия нейросети, которая живёт на сервере вендора. Это архитектурный паттерн, обычный цикл на стороне вашего собственного кода.

Механика выглядит следующим образом. В системном промпте вы передаёте модели список доступных функций. Мы называем их инструментами. Когда пользователь ставит задачу, модель анализирует её и понимает, что прямого ответа у неё нет. Вместо финального текста она возвращает JSON-объект с командой: вызови конкретный инструмент с определёнными аргументами. На этом участие языковой модели в текущем шаге полностью заканчивается.

Дальше в дело вступает ваш бэкенд. Ваш код парсит полученный ответ. Он выполняет нужную функцию локально — например, делает SQL-запрос к базе данных или ищет свежую информацию через поисковый API. Затем скрипт берёт полученный результат, приклеивает его в конец истории переписки и отправляет весь этот массив данных обратно к провайдеру. Модель читает новые вводные и принимает решение: вызвать следующий инструмент или сформировать итоговый ответ пользователю. Этот цикл повторяется до тех пор, пока задача не будет закрыта.

Блок-схема цикличного обмена данными между сервером и языковой моделью.
ИИ-агент — это не самостоятельная программа, а бесконечный цикл запросов на стороне вашего сервера.
Сама модель не имеет доступа к интернету и не исполняет скрипты. Она лишь генерирует текстовые инструкции, которые послушно выполняет ваш сервер.

Почему счёт за токены растёт по квадратичной кривой

Главная проблема стоимости таких систем заключается в том, что API языковых моделей не имеет встроенной памяти. Провайдер абсолютно не помнит, что вы отправляли ему секунду назад. Состояние между запросами не сохраняется.

Из-за этого на каждом новом витке цикла ваш код вынужден отправлять всю накопленную историю переписки заново. Токен — это базовый кусочек текста, которым модель измеряет объём информации, и за который вам выставляют счёт. Если ваш скрипт делает десять шагов, вы платите за системный промпт и описание всех инструментов десять раз подряд. Вы платите за результат первого шага девять раз. За результат второго — восемь раз. И так далее по убывающей.

История переписки растёт линейно, но потребление токенов увеличивается квадратично. Двадцать шагов агента вместо десяти — это не в два раза более дорогой запуск. Это рост итогового чека примерно в четыре раза. Каждый новый вызов тащит за собой весь тяжёлый груз предыдущей переписки. Кроме того, подробные описания инструментов отправляются в каждом запросе. Они необходимы для точной работы генерации, но стабильно добавляют тысячи токенов к каждому сетевому вызову. Именно этот незаметный снежный ком контекста стремительно сжигает баланс.

Свой расчёт стоимости одного прогона

Мы решили показать масштаб проблемы на конкретных цифрах. Мы составили математическую модель расхода на типичной задаче. Это замер потребления, а не бенчмарк качества ответов. Все цены актуальны на 28.08.2026.

Условия замера строгие. Скрипт выполняет задачу ровно за десять шагов. Системный промпт с подробным описанием инструментов занимает 1500 токенов. Каждый шаг с вызовом функции и возвратом результата добавляет к истории переписки примерно 700 токенов. Генерация ответа модели на каждом этапе составляет 300 токенов.

Считаем входные токены. На первом шаге отправляется 1500 токенов. На втором — уже 2200. Формула входа на любом шаге выглядит так: 1500 плюс 700, умноженное на номер шага минус один. Сумма входных токенов за десять итераций составляет 46 500.

График квадратичного роста количества отправляемых токенов с каждым новым шагом агента.
Из-за отсутствия памяти у API каждый новый шаг оплачивает всю предыдущую переписку заново.
Выходные токены суммарно за весь прогон занимают 3000.

Мы применили этот профиль потребления к нашим ценам. Скидка указана от официальной цены вендора за один миллион токенов. Дата снятия цен — 28.08.2026.

МодельНаш вход / выход (за 1 млн)Скидка от цены вендораСтоимость одного прогона
gemini-3.1-flash-lite$0,225 / $1,3510%$0,0145
claude-haiku-4-5$0,771925 / $3,99997520%$0,0479
gpt-5.6-mini$0,8501 / $5,100515%$0,0548
claude-sonnet-5$1,6898 / $8,498715%$0,1041
gpt-5.6$2,1252 / $12,751215%$0,1371

Разница в стоимости одного прогона между самой дешёвой и самой дорогой моделью достигает 9,4 раза. При этом разница в базовых тарифах за миллион токенов на 28.08.2026 кажется не такой пугающей. Обычно разработчики смотрят на цену выходных токенов, потому что они всегда стоят дороже входных. Однако у цикличного скрипта выход маленький, а вход огромный. В такой архитектуре всё решает цена входного токена, на которую часто смотрят в последнюю очередь. Тысяча прогонов в месяц обойдётся от 14,51 доллара на лёгкой модели до 137,08 доллара на флагманской.

Сравнение стоимости тысячи прогонов между легкой и флагманской ИИ-моделью в виде двух столбцов.
Правильный выбор модели для рутинных задач снижает расходы на API почти в десять раз.

Три способа снизить цену шага без потери качества

Оптимизация расходов сводится к жёсткому контролю над растущим контекстом и правильному выбору моделей. Вот три практических шага, которые меняют экономику проекта.

Первое. Используйте кэширование контекста. Это главный инструмент снижения боли. Суть в том, чтобы зафиксировать статичную часть промпта в начале контекстного окна. Провайдер кэширует системные инструкции и объёмные описания инструментов. При последующих запросах чтение из кэша стоит примерно десятую долю от цены обычного входного токена. Это радикально срезает стоимость каждого шага.

Второе. Разделяйте задачи между разными моделями. Не обязательно гонять тяжёлую gpt-5.6 на каждом этапе. Формальные рутинные шаги отлично выполняет лёгкая и дешёвая модель вроде gemini-3.1-flash-lite. Сильную модель стоит вызывать только для принятия сложных решений о маршрутизации или для разбора запутанных краевых случаев. Большинство эффективных систем собираются на двух моделях одновременно.

Третье. Оптимизируйте описания инструментов. Десять функций с избыточными описаниями — это лишняя тысяча токенов на каждом шаге. Оставляйте только те инструменты, которые действительно нужны для текущего сценария. Описывайте их параметры максимально лаконично, без лишней воды.

Чего маршрутизатор не сделает за вас

Мы прозрачно говорим о наших ограничениях. Сервис altrouter даёт единый доступ к API разных моделей. Мы позволяем переключаться между ними без переписывания интеграции и предоставляем цены со скидками от официальных прайсов вендоров. На 28.08.2026 эти скидки доходят до 20 процентов.

Но мы не напишем логику за вас. У нас нет визуального конструктора, зеро-код платформы или готовых шаблонов для сборки. Цикл вызова инструментов, парсинг ответов и управление историей переписки — это программная логика. Вам или вашим разработчикам придётся написать её кодом самостоятельно. Идея про сборку надёжных систем без программиста — это маркетинговый миф, который мы не поддерживаем.

Частые вопросы

Чем ИИ-агент отличается от обычного промпта?

Обычный запрос — это разовая операция. Вы отправили текст и получили ответ. Агент — это цикл в вашем коде, где модель просит вызвать функцию, код её выполняет, возвращает результат модели, и так по кругу до решения задачи.

Почему счёт за токены растёт с каждым шагом агента?

API моделей не имеет памяти. На каждом новом шаге ваш код должен отправлять всю предыдущую историю переписки заново. Оплата идёт за весь объём отправленного текста каждый раз, включая старые сообщения.

Можно ли собрать агента без программиста?

Надёжную систему для продакшена — нет. Механика требует написания цикла, обработки ошибок, парсинга ответов и интеграции с вашими внутренними системами. Существуют визуальные конструкторы, но их возможности ограничены.

Как кэширование контекста снижает цену агента?

Кэширование позволяет один раз загрузить тяжёлую неизменную часть на сервер провайдера. Чтение этих данных из кэша на каждом шаге стоит примерно в десять раз дешевле, чем отправка их заново в виде обычных входных токенов.

Понимание того, как растёт история переписки, позволяет заранее спрогнозировать бюджет и заложить правильную архитектуру. Используйте кэширование, комбинируйте лёгкие и тяжёлые модели, и математика вашего проекта сойдётся.

Единый API для доступа к моделям со скидками от официальных цен вендоров: altrouter.ai.

Актуальные цены и доступные модели на 28.08.2026: altrouter.ai/models.