Вопросы по оплате
Почему после одного сообщения я вижу несколько записей о списании?
Одна операция в агентном инструменте может незаметно вызвать несколько реальных обращений к модели.
Например:
- Сначала инструмент может попросить модель понять задачу.
- Затем сделать ещё один запрос, чтобы прочитать файлы или спланировать правки.
- После выполнения инструмента — снова обратиться к модели.
- Некоторые клиенты также повторяют запросы или делят длинную работу на несколько обращений.
Вы видите одну операцию или один диалог. Биллинг фиксирует каждый реальный вызов модели, который за этим стоит.
Почему я выбрал gpt-5.5, а в биллинге вижу gpt-5.4-mini?
Некоторые клиенты, агенты или политики маршрутизации используют меньшую модель для вспомогательной работы: классификации, планирования, суммаризации или короткой проверки.
Это не значит, что выбор основной модели не сработал. Просто часть рабочего процесса выполнила вспомогательный вызов другой моделью.
Что такое чтение и запись кэша? Почему у них разная цена?
Многие LLM-провайдеры используют кэширование промптов.
- Запись кэша: провайдер сохраняет переиспользуемый контекст — длинные системные промпты, файлы проекта или контекст предыдущего диалога.
- Чтение кэша: провайдер повторно использует сохранённый контекст.
Запись кэша обычно дороже чтения, потому что провайдеру нужно обработать и сохранить контекст. Чтение кэша, как правило, дешевле.
Почему некоторые запросы с малым числом входных токенов всё равно стоят дороже?
Возможные причины:
- Запрос вызвал запись кэша.
- У использованной модели более высокая цена за единицу.
- Клиент сделал несколько скрытых вызовов вокруг видимого действия.
- Выходных токенов или токенов рассуждения оказалось больше, чем ожидалось.
Прежде чем оценивать стоимость, посмотрите вместе ID модели, входные и выходные токены, токены чтения и записи кэша.
Почему ожидаемая стоимость и фактическое списание отличаются?
Ожидаемая стоимость рассчитывается по деталям использования модели. Фактическое списание может отличаться из-за округления, скидок, правил тарификации кэша, правил расчётов на уровне аккаунта или корректировок со стороны провайдера.
Если разница выглядит аномальной, сохраните ID запроса и обратитесь в поддержку.
Почему Fast Mode стоит дороже?
В Fast Mode прайсовая цена модели в 2 раза выше цены стандартного режима, а ваша текущая скидка по аккаунту не меняется.
Например, если стандартный вывод стоит по прайсу $25 / 1M токенов, а скидка аккаунта 10 %, то в Fast Mode вывод стоит $50 / 1M токенов по прайсу, и та же скидка 10 % продолжает действовать. Пометка Fast в биллинге означает, что запрос обработан с включённым Fast Mode.
Чтобы выключить его, отключите Fast Mode в Codex или в вызывающем клиенте перед следующим запросом.
Почему баланс со временем расходуется быстрее? Как уменьшить расход?
Агентные инструменты отправляют всё больший контекст по мере роста проекта. Длинные диалоги, больше файлов и повторные вызовы инструментов увеличивают расход токенов.
Чтобы снизить стоимость:
- Начинайте новый диалог, когда старый контекст больше не нужен.
- Не просите агента читать весь проект без необходимости.
- Для простых задач используйте модели поменьше.
- Используйте потоковый ответ, чтобы видеть ответ по мере генерации, но помните: сам по себе он не уменьшает расход токенов.
- Следите за записями кэша. Частые перезаписи кэша могут увеличивать стоимость.
Когда обращаться в поддержку?
Обратитесь в поддержку, если:
- Вы видите запросы, которых не делали.
- ID модели явно не тот, который вы настроили.
- Фактическое списание сильно расходится с деталями использования.
- Запросы завершаются ошибкой, но, судя по всему, всё равно тарифицируются.
- Вам нужна помощь с записями о кэше или токенах.
Укажите время запроса, ID модели, ID запроса (если есть) и приложите скриншот записи биллинга.