Вопросы по оплате

Почему после одного сообщения я вижу несколько записей о списании?

Одна операция в агентном инструменте может незаметно вызвать несколько реальных обращений к модели.

Например:

  • Сначала инструмент может попросить модель понять задачу.
  • Затем сделать ещё один запрос, чтобы прочитать файлы или спланировать правки.
  • После выполнения инструмента — снова обратиться к модели.
  • Некоторые клиенты также повторяют запросы или делят длинную работу на несколько обращений.

Вы видите одну операцию или один диалог. Биллинг фиксирует каждый реальный вызов модели, который за этим стоит.

Почему я выбрал gpt-5.5, а в биллинге вижу gpt-5.4-mini?

Некоторые клиенты, агенты или политики маршрутизации используют меньшую модель для вспомогательной работы: классификации, планирования, суммаризации или короткой проверки.

Это не значит, что выбор основной модели не сработал. Просто часть рабочего процесса выполнила вспомогательный вызов другой моделью.

Что такое чтение и запись кэша? Почему у них разная цена?

Многие LLM-провайдеры используют кэширование промптов.

  • Запись кэша: провайдер сохраняет переиспользуемый контекст — длинные системные промпты, файлы проекта или контекст предыдущего диалога.
  • Чтение кэша: провайдер повторно использует сохранённый контекст.

Запись кэша обычно дороже чтения, потому что провайдеру нужно обработать и сохранить контекст. Чтение кэша, как правило, дешевле.

Почему некоторые запросы с малым числом входных токенов всё равно стоят дороже?

Возможные причины:

  • Запрос вызвал запись кэша.
  • У использованной модели более высокая цена за единицу.
  • Клиент сделал несколько скрытых вызовов вокруг видимого действия.
  • Выходных токенов или токенов рассуждения оказалось больше, чем ожидалось.

Прежде чем оценивать стоимость, посмотрите вместе ID модели, входные и выходные токены, токены чтения и записи кэша.

Почему ожидаемая стоимость и фактическое списание отличаются?

Ожидаемая стоимость рассчитывается по деталям использования модели. Фактическое списание может отличаться из-за округления, скидок, правил тарификации кэша, правил расчётов на уровне аккаунта или корректировок со стороны провайдера.

Если разница выглядит аномальной, сохраните ID запроса и обратитесь в поддержку.

Почему Fast Mode стоит дороже?

В Fast Mode прайсовая цена модели в 2 раза выше цены стандартного режима, а ваша текущая скидка по аккаунту не меняется.

Например, если стандартный вывод стоит по прайсу $25 / 1M токенов, а скидка аккаунта 10 %, то в Fast Mode вывод стоит $50 / 1M токенов по прайсу, и та же скидка 10 % продолжает действовать. Пометка Fast в биллинге означает, что запрос обработан с включённым Fast Mode.

Чтобы выключить его, отключите Fast Mode в Codex или в вызывающем клиенте перед следующим запросом.

Почему баланс со временем расходуется быстрее? Как уменьшить расход?

Агентные инструменты отправляют всё больший контекст по мере роста проекта. Длинные диалоги, больше файлов и повторные вызовы инструментов увеличивают расход токенов.

Чтобы снизить стоимость:

  • Начинайте новый диалог, когда старый контекст больше не нужен.
  • Не просите агента читать весь проект без необходимости.
  • Для простых задач используйте модели поменьше.
  • Используйте потоковый ответ, чтобы видеть ответ по мере генерации, но помните: сам по себе он не уменьшает расход токенов.
  • Следите за записями кэша. Частые перезаписи кэша могут увеличивать стоимость.

Когда обращаться в поддержку?

Обратитесь в поддержку, если:

  • Вы видите запросы, которых не делали.
  • ID модели явно не тот, который вы настроили.
  • Фактическое списание сильно расходится с деталями использования.
  • Запросы завершаются ошибкой, но, судя по всему, всё равно тарифицируются.
  • Вам нужна помощь с записями о кэше или токенах.

Укажите время запроса, ID модели, ID запроса (если есть) и приложите скриншот записи биллинга.

Готовы? Три шага, чтобы начатьВойдите в консоль · пополните баланс · создайте API Key
DiscordПомощь сообщества
Вопросы по оплате · Документация