Токен — это единица, которой модели считают текст. Не буква и не слово: разработчик режет текст на куски по своему словарю, и дальше вся арифметика идёт в этих кусках — длина запроса, объём ответа и счёт в конце месяца. Именно поэтому цены у всех объявлены одинаково: сумма за миллион токенов, отдельно за отправленное и отдельно за полученное.
Дальше по порядку: миллион токенов это сколько текста на самом деле, из чего складывается счёт за один вызов, сколько стоит миллион токенов в рублях у пяти текстовых моделей каталога и каким способом посчитать собственный расход по факту, а не по чужим прикидкам.
Миллион токенов — это сколько текста
Точного ответа на этот вопрос не существует, и это не уклонение от него. У каждого разработчика свой токенизатор — правила, по которым текст разбирается на токены. Одна и та же фраза у двух разных моделей даст разное число, а внутри одной модели результат ещё зависит от языка: словари собраны в основном на английском материале, поэтому русский текст дробится мельче. Любое соотношение вида «в одном токене столько-то знаков» — оценка, а не постоянная величина.
Своя оценка есть и у шлюза, и она намеренно осторожная. Когда под запрос резервируются деньги, отправленное пересчитывается из расчёта два знака на токен. Величина эта наша, расчётная, а не свойство самих моделей, и выбрана она по худшему случаю: латиница даёт примерно четыре знака на токен, кириллица около двух, а заниженная оценка увела бы баланс в минус.
Отсюда получается перевод, которым можно пользоваться для прикидки: миллион входных токенов по нашей оценке — это порядка двух миллионов знаков русского текста. В обратную сторону работает так же: статья на десять тысяч знаков превращается примерно в пять тысяч токенов входа.
Пересчёт в страницы требует ещё одного допущения, и назвать его нужно вслух. Если принять машинописную страницу за 1800 знаков — это принятая редакторская норма, а не измерение конкретно вашего текста, — то два миллиона знаков дают около 1100 таких страниц. Числа в этой строке держатся сразу на двух условностях: на нашей оценке в два знака и на норме страницы. Настоящее количество токенов знает только сама модель, и становится оно известно после вызова: сервис возвращает фактический расход вместе с ответом.
Из чего складывается счёт
У текстовой модели две отдельные ставки, и различать их важнее, чем кажется. Входными считаются токены всего отправленного: системная инструкция, ваш вопрос, приложенный текст и вся предыдущая переписка, которую программа пересылает заново при каждом обращении, потому что модель прошлый разговор не помнит. Выходные — те, из которых собран ответ. Выход дороже входа у всех моделей каталога, поэтому длина ответа влияет на сумму сильнее, чем длина вопроса.
К этому добавляется служебная часть. На каждое сообщение в переписке шлюз при оценке кладёт ещё восемь токенов — на обозначение отправителя и разметку формата беседы. В одном коротком вопросе доля незаметная, но в диалоге на сотню реплик одна эта добавка даёт восемьсот токенов, а сама переписка к тому времени идёт во вход целиком каждый раз.
Длину ответа задаёт параметр запроса max_tokens. Если его не прислать, ответ по умолчанию ограничивается 1024 токенами. Резерв под ответ при этом держится с запасом — не меньше чем под четыре тысячи токенов: поставщики заданный потолок соблюдают не всегда, и заниженное удержание уводило бы счёт в минус. Попросить можно больше, вплоть до 128 000 токенов; значения выше шлюз не принимает, потому что почти всегда это описка в коде, а удержание под такую цифру заморозило бы весь остаток на счёте.
И последнее, что стоит развести: удержание — не списание. Пока вызов идёт, на счету блокируется оценочная сумма, посчитанная по правилам выше. Когда ответ получен, со счёта уходит фактический расход, а разница между оценкой и фактом возвращается обратно. Отказ не оплачивается вовсе.
Сколько стоит миллион токенов в рублях
Ставки текстовых моделей каталога — рубли за миллион токенов, отдельной колонкой на отправленное и на полученное.
| Модель | Миллион входных токенов | Миллион выходных токенов |
|---|---|---|
| GPT-5.6 Luna | 18 ₽ | 108 ₽ |
| GPT-5.6 Terra | 180 ₽ | 1080 ₽ |
| GPT-5.6 Sol | 450 ₽ | 2700 ₽ |
| Gemini 3.6 Flash | 135 ₽ | 675 ₽ |
| Grok 4.5 | 180 ₽ | 540 ₽ |
Смотреть на таблицу лучше не столбцами, а строками. Разница между ступенями внутри одного семейства и между семействами разных разработчиков куда заметнее, чем всё, что можно выгадать сокращением обращений: итоговую сумму решает взятая под задачу ступень, а не аккуратность формулировок. Короткая разметка текста, извлечение полей из документа и простые ответы обычно уходят на нижние ступени, длинные рассуждения и код — на верхние.
Назначение каждой модели, объём контекста и прочие характеристики собраны отдельно — нейросеть для текста; весь набор вместе с моделями для картинок и видео лежит в каталоге.
Как прикинуть свой расход
Теоретические подсчёты здесь дают меньше, чем один прогон. Причина простая: главная переменная — длина ответа, а её до генерации не знает никто, включая саму модель. Поэтому порядок такой.
Возьмите настоящее задание, а не пример из документации. Средняя длина ваших запросов, объём приложенных материалов, привычка модели отвечать развёрнуто или коротко — всё это у каждой задачи своё, и подставить сюда чужие цифры нельзя.
Прогоните его один раз и посмотрите на фактический расход. Он приходит в ответе сервиса вместе с текстом, а в кабинете тот же вызов остаётся в журнале — видно, что ушло и что вернулось. Это и есть настоящая цена одного обращения по вашей задаче.
Умножьте на ожидаемое число обращений. Дневная нагрузка, помноженная на цену одного вызова, — вот и вся смета, и она построена на замере, а не на переводных коэффициентах.
Повторите на второй модели. Замена одного значения в поле запроса даёт вторую строку для сравнения, и решение «дешевле или качественнее» принимается по двум настоящим ответам, а не по обзорам.
На такую проверку и рассчитано стартовое начисление: при первом входе счёт пополняется на 50 кредитов (25 ₽). По ставкам из таблицы выше стартового баланса достаточно, чтобы пропустить свой материал по нескольким ступеням каталога и получить собственные числа раньше, чем понадобится платить. Дальше счёт пополняется рублями, наименьший платёж — 500 ₽.
Порядок выпуска ключа разобран отдельно — как получить API-ключ; первый вызов по шагам, вместе с разбором ответа, лежит в разделе документация.
Частые вопросы
Миллион токенов — это сколько слов? В словах модели не считают, поэтому честный ответ будет с оговоркой. Через нашу расчётную оценку в два знака на токен миллион входных токенов — это около двух миллионов знаков русского текста; сколько в них слов, зависит от того, насколько эти слова длинные. Приводить точное соотношение токенов к словам не стоит никому: у каждого разработчика свой способ разбивки, и у одного и того же текста число токенов в разных моделях будет разным. Для планирования достаточно знаков, для точности — фактического расхода, который возвращается после вызова.
Почему выход дороже входа? Потому что так устроены цены у самих разработчиков моделей, а шлюз наследует эту структуру, а не придумывает свою. Отправленный текст модель только читает, ответ она порождает — и по всем известным нам ценам вторая работа стоит дороже первой. Практический вывод отсюда один: сокращать имеет смысл прежде всего ответ, а не запрос. Если задача требует короткого результата — короткий список, поле из документа, одно предложение, — попросите об этом в самой инструкции и ограничьте длину ответа параметром запроса.
Сколько стоит токен у GPT? Поштучно его никто не объявляет, и не случайно: стоимость токенов GPT в пересчёте на одну штуку — это доли копейки, считать в таких величинах неудобно. Поэтому ставка называется за миллион, а цена одного токена получается делением. У линейки GPT-5.6 три ступени с разными ставками, они стоят в таблице выше отдельными строками; что это за ступени и чем они отличаются, разобрано в статье GPT по API.
Можно ли узнать сумму заранее, до вызова? Полностью — нет, и любой сервис, который обещает обратное, обещает лишнее. Заранее известны ставки и приблизительный объём отправленного; неизвестна длина ответа, а она и решает. Что можно сделать: ограничить ответ параметром запроса, выбрать модель по цене выхода, а не только входа, и снять фактические числа одним прогоном своей задачи. После этого прогноз строится на замере, а не на предположении.