← Блог

Русский текст дороже английского - но уже не вдвое

· 7 минут чтения

Коротко

Правило «русский текст расходует вдвое больше токенов» устарело. Оно верно для моделей поколения GPT-4 и GPT-3.5 и заметно завышает бюджет для современных.

Мы прогнали одни и те же фразы через два токенизатора OpenAI - старый cl100k_base и нынешний o200k_base. Замер от 23.08.2026:

ТокенизаторРусскийАнглийскийОтношение
cl100k_base (GPT-4, GPT-3.5)149 токенов74×2.01
o200k_base (GPT-5.x, GPT-4o)91 токен74×1.23

Английский текст не изменился вообще - 74 токена в обоих случаях. Подешевел именно русский, почти в полтора раза.

Две колонки, показывающие снижение коэффициента стоимости русского текста с 2.01 до 1.23.
Современные модели токенизируют русский текст гораздо эффективнее старых поколений.

Ниже - что такое токен, откуда взялась двойка, что показал замер на реальной статье и как теперь прикидывать счёт.

Что такое токен и почему язык на это влияет

Токен - кусок текста, которым модель оперирует. Это не буква и не слово: частые куски языка становятся одним токеном, редкие рубятся на несколько. Платите вы за токены, а не за символы.

Токенизатор - таблица таких кусков, собранная на обучающих текстах. Чего в этих текстах было много, то попало в таблицу целиком; чего было мало - распадается на обрывки.

Отсюда вся разница между языками. Английского в интернете больше, поэтому английские слова в таблице лежат целиком: support - один токен. Русского меньше, и слово собирается из частей.

Вот как это выглядит на конкретных словах в двух таблицах:

Схема дробления слова нейросеть на 5 токенов в старом словаре и на 3 токена в новом.
Новые словари содержат больше русских слогов, поэтому слова рубятся на меньшее число кусков.

Словоcl100k_baseo200k_base
support11
neural22
привет42
нейросеть53
поддержки53

Английские слова не сдвинулись. Русские подешевели почти вдвое - потому что в новую таблицу попало больше русских кусков.

Как мерили

Метод, чтобы результат можно было проверить или оспорить:

  • Библиотека gpt-tokenizer 4.0.0, кодировки o200k_base и cl100k_base.
  • Четыре пары фраз: обращение в поддержку, баг-репорт, служебная инструкция, определение из словаря. В каждой паре русский и английский вариант - об одном и том же и примерно одной длины в символах.
  • Дата замера - 23.08.2026.

По отдельным парам отношение гуляет от ×1.10 до ×1.30, суммарно ×1.23. Разброс - нормальная вещь: технический текст с латинскими терминами внутри ближе к единице, чистая русская проза - к верхней границе.

🔴 Границы замера, которые важно назвать вслух. Это токенизаторы OpenAI. У Anthropic и Google свои, и я их не мерил - доступного офлайн-инструмента для них нет. Направление там то же: новые поколения моделей режут кириллицу лучше старых. Но точный множитель будет другим, и переносить наши 1,23 на Claude или Gemini как факт нельзя. Проверять надо на своих текстах и своей модели.

Замер на реальном тексте

Отдельные фразы - это лабораторные условия. Прогнали целиком одну статью этого блога: 1216 слов, 8570 знаков, русская проза с вкраплениями кода.

ТокенизаторТокеновНа словоЗнаков на токен
cl100k_base36352.992.36
o200k_base24141.993.55

Практическая прикидка для русского текста: два токена на слово. Раньше было три.

Условная страница в 1800 знаков - 496 токенов на новом токенизаторе против 782 на старом. Старое эмпирическое правило «страница - это примерно 700 токенов» завышает почти в полтора раза.

Заметьте, что «4 символа на токен» - цифра из англоязычной документации - для русского не работает ни в одном из вариантов: у нас 3,55 знака на токен даже на новом токенизаторе.

Что это меняет в счёте

Считаем поддержку: 100 000 обращений в месяц, около 250 слов контекста и 80 слов ответа на каждое. Цены - по каталогу на 23.08.2026, модель Claude Haiku 4.5.

ПрикидкаТокенов на обращениеСчёт за месяц
По старому правилу (3 токена на слово)750 вход + 240 выход$153.89
По новому замеру (2 токена на слово)500 вход + 160 выход$102.60

Разница - треть бюджета.

Сравнение сметы: расчет по старому правилу дает 153.89 долларов, а по новому — 102.60 долларов.
Использование устаревших метрик заставляет закладывать бюджет на треть больше реального расхода.
Причём это разница не в реальных деньгах, а в вашей оценке: платите вы одинаково, но по старому правилу вы заложите на треть больше, чем нужно, и, возможно, откажетесь от модели, которая на самом деле проходила по бюджету.

Ошибка работает и в обратную сторону. Если у вас старая модель или свой сервис на токенизаторе прошлого поколения - новая прикидка занизит счёт, и это будет неприятнее.

Что делать с этим на практике

Не берите множитель из статьи - померьте свой текст. Ваши данные не похожи ни на нашу статью, ни на наши четыре фразы. Тексты с большим количеством латиницы, кода, чисел и имён собственных ведут себя ближе к английским.

Смотрите на usage в ответе. Каждый ответ API содержит реальное число потраченных токенов. Это точнее любой прикидки, потому что учитывает и служебные части запроса, и особенности конкретной модели.

Считайте бюджет по своей выборке. Возьмите сотню настоящих запросов, прогоните, сложите usage - получите цифру, которой можно верить.

🔴 Не экономьте, переводя промпт на английский. Разница в 23% по токенам - не тот выигрыш, ради которого стоит писать пользовательские инструкции на чужом языке: качество работы с русскоязычным контентом обычно проседает сильнее, чем экономия. Единственное исключение - длинный системный промпт, который не зависит от языка данных и повторяется в каждом запросе.

С чего начать

  1. Узнайте, какая модель у вас в проде и какого она поколения. Правило «×2» применимо только к старым.
  2. Прикиньте по новому: два токена на слово для русского текста.
  3. Сверьте с usage на сотне реальных запросов и замените прикидку фактом.
  4. Заложите запас на системный промпт - он повторяется в каждом запросе и в бюджете часто теряется.
  5. Пересчитайте выбор модели - задача, не проходившая по бюджету на старой прикидке, могла стать проходной.

Все 44 модели с ценами за миллион токенов - на витрине. Полный разбор цен по моделям - в обзоре стоимости, а способы сократить сам объём - в десяти приёмах.

FAQ

Сколько токенов в русском тексте?

На современном токенизаторе - около двух токенов на слово и 3,5 знака на токен. Страница в 1800 знаков занимает примерно 500 токенов. На моделях прошлого поколения те же тексты давали три токена на слово и около 780 токенов на страницу.

Правда ли, что русский текст стоит вдвое дороже английского?

Это было правдой для GPT-4 и GPT-3.5: замер на cl100k_base даёт отношение 2,01. На нынешнем o200k_base те же фразы дают 1,23 - то есть примерно на четверть дороже, а не вдвое.

Почему кириллица расходует больше токенов?

Токенизатор - это таблица частых кусков текста, собранная на обучающих данных. Английского в них больше, поэтому английские слова попадают в таблицу целиком, а русские собираются из нескольких частей. Чем больше русского было при сборке таблицы, тем ближе языки по стоимости.

Стоит ли писать промпты на английском ради экономии?

Ради 23% - обычно нет: работа с русскоязычным контентом при этом чаще проседает сильнее, чем экономия. Смысл есть только для длинного системного промпта, который не зависит от языка данных и повторяется в каждом запросе.

Как точно узнать, сколько токенов потратил мой запрос?

Посмотреть поле usage в ответе API - там реальные числа входных и выходных токенов по факту. Любая прикидка по словам или символам не учитывает служебные части запроса и особенности конкретной модели.

Относится ли ваш замер к Claude и Gemini?

Нет. Мы мерили токенизаторы OpenAI, потому что для них есть доступный офлайн-инструмент. У Anthropic и Google собственные таблицы, и множитель у них свой. Направление то же - новые поколения режут кириллицу экономнее старых, - но конкретные числа надо проверять на своей модели через usage.