Короткий ответ
Fast mode в GPT 5.6 Sol — это платное снижение задержки для флагманской модели OpenAI. За двойную цену запросы с пометкой service_tier: "fast" выполняются до 2.5 раза быстрее, чем при обработке Standard, а интеллект модели не меняется. 30 июля 2026 года OpenAI переименовала «Priority Processing» в Fast mode, но API полностью обратно совместим — старое значение "priority" по-прежнему работает. Режим можно включать для отдельных запросов или задать как значение по умолчанию для проекта. Если вы работаете с GPT 5.6 Sol через шлюз вроде TeamoRouter, Fast mode доступен с той же настройкой в один ключ.
Что на самом деле изменилось 30 июля 2026 года
OpenAI без лишнего шума отправила бренд «Priority processing» на покой и заменила его на Fast mode. Механизм тот же, название новое, цены стали понятнее. Главное обещание:
- До 2.5 раза быстрее, чем Standard, для
gpt-5.6-sol - Примерно в 2 раза дороже Standard (Fast mode тарифицируется как надбавка к базовым ценам на токены)
- Интеллект не меняется совсем — это апгрейд исключительно скорости и стабильности. Та же модель, те же ответы, меньше задержка.
Переименование важно по одной причине: оно показывает, что OpenAI рассматривает задержку как полноценную продуктовую характеристику, а не как внутреннюю деталь SLA. Теперь Fast mode поставляется с явными SLA:
| SLA | Что обещает Fast mode |
|---|---|
| Аптайм | 99.9% |
| Задержка | 99% запросов >80 токенов в секунду |
Для интерактивных инструментов — живых помощников по коду, агентных циклов, где вы ждёте каждый шаг, чат-интерфейсов — именно эти цифры определяют, ощущается ли продукт мгновенным или тормозным.
Как включить Fast mode
Fast mode включается для каждого запроса отдельно — параметром service_tier. Он работает и в Chat Completions API, и в Responses API и распространяется на всё семейство GPT-5.6 (gpt-5.6-sol, gpt-5.6-terra, gpt-5.6-luna).
curl
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer sk-your-key" \
-H "content-type: application/json" \
-d '{
"model": "gpt-5.6-sol",
"input": "Explain how Fast mode routing works, briefly.",
"service_tier": "fast"
}'
Python (openai SDK)
from openai import OpenAI
client = OpenAI(api_key="sk-your-key")
resp = client.responses.create(
model="gpt-5.6-sol",
input="Summarize the three most important trade-offs of Fast mode.",
service_tier="fast",
)
print(resp.output_text)
Node.js
import OpenAI from "openai";
const client = new OpenAI({ apiKey: "sk-your-key" });
const resp = await client.responses.create({
model: "gpt-5.6-sol",
input: "What latency does Fast mode target?",
service_tier: "fast",
});
console.log(resp.output_text);
Значение по умолчанию для проекта
Если вы хотите, чтобы в проекте всё работало в Fast mode без правки каждого запроса, задайте service tier по умолчанию в настройках проекта на OpenAI Platform. Тогда каждый запрос из этого проекта автоматически пойдёт в Fast mode, а переопределить режим для отдельного запроса по-прежнему можно, явно передав service_tier.
Старое значение по-прежнему работает
OpenAI намеренно сохранила старое написание. Запросы с пометкой
"service_tier": "priority"
по-прежнему принимаются и идут по тому же пути Fast mode. Это важно, если у вас есть старые интеграции или сторонние инструменты, где "priority" зашито в код, — после переименования они продолжат работать. Учтите, что для GPT-5.6 и более ранних моделей поле service_tier в объекте ответа может по-прежнему возвращать "priority", даже если вы отправили "fast". Это ожидаемо и ни на что не влияет.
Насколько это быстро на самом деле?
OpenAI заявляет ускорение до 2.5 раза относительно Standard. Первые независимые замеры в сообществе разработчиков показали реальное ускорение ~1.5-1.6 раза на задачах Codex для gpt-5.6-sol — всё равно существенно, но 2.5x — это потолок, а не гарантия. Фактическое ускорение зависит от следующего:
- Размер запроса. Длинные ответы выигрывают больше, потому что узким местом становится пропускная способность (>80 токенов/с).
- Глубина очереди. Fast mode покупает вам приоритет в очереди, поэтому выигрыш максимален, когда очередь Standard перегружена.
- Нагрузка на серверы. В пиковые часы Fast mode держит планку; вне пика Standard и так может быть быстрым.
Если говорить честно: вы платите не за более быструю модель, а за стабильно низкую задержку под нагрузкой. Если трафик небольшой и приходится на непиковое время, разницы вы можете и не заметить — и заплатите вдвое больше ни за что. Если же у вашего продукта есть целевые показатели интерактивной задержки в рабочие часы, Fast mode — способ в них уложиться.
Цены: что означает «2x» в долларах
Базовые цены API на GPT-5.6 Sol не изменились:
| Позиция | Цена за 1M токенов |
|---|---|
| Вход (промах кэша) | $5.00 |
| Вход (попадание в кэш) | $0.50 |
| Выход | $30.00 |
В Fast mode токены тарифицируются примерно в 2 раза дороже, чем в Standard. То есть запрос, который в Standard стоит $1.00, в Fast обойдётся примерно в $2.00.
| Нагрузка (в день) | Standard | Fast mode (~2x) |
|---|---|---|
| 1M вход / 500K выход | $5.00 + $15.00 = $20.00 | ~$40.00 |
| 5M вход / 2M выход | $25.00 + $60.00 = $85.00 | ~$170.00 |
| 50M вход / 20M выход | $250.00 + $600.00 = $850.00 | ~$1 700.00 |
При ценовом уровне GPT-5.6 Sol надбавка за Fast mode существенная. Именно поэтому так важен вопрос маршрутизации с оглядкой на расходы: Fast mode нужен на интерактивном пути, а во всех остальных местах — Standard (или модель подешевле).
Когда Fast mode себя оправдывает
Платите за Fast mode, когда:
- Каждого запроса ждёт человек. Живые помощники по коду (Codex, IDE-агенты, терминальные инструменты), чат-боты, интерфейсы парного программирования. Задержка — это пользовательский опыт.
- Вы запускаете последовательные агентные циклы. Если каждый шаг агента ждёт предыдущего, задержка накапливается на протяжении всего прогона. Ускорение в 2 раза на 20-шаговом агенте — это не «в 2 раза быстрее»: полное время выполнения задачи может сократиться в 5-10 раз.
- Вам нужно уложиться в SLA по задержке. Аптайм 99.9% + 99% запросов на скорости >80 токенов/с — это договорная гарантия, на которую можно опираться.
- Всплески трафика — норма. Fast mode защищает интерактивную пропускную способность, когда все ваши пользователи приходят одновременно.
Обойдитесь без Fast mode, когда:
- Вы запускаете пакетные задания, эвалы или офлайн-генерацию. Для таких сценариев режим прямо не предназначен. OpenAI может понизить fast-трафик, похожий на пакетный (см. оговорку ниже), и выставить счёт по тарифу Standard.
- Главное ограничение — стоимость. При цене 2x для объёмной фоновой нагрузки разумнее вообще взять модель подешевле: например, DeepSeek V4 Flash за $0.14/$0.28 в 100 раз дешевле GPT-5.6 Sol в Fast mode.
- Вы и так работаете вне пика, и задержка устраивает. Не платите за приоритет, который вам не нужен.
Оговорка о понижении, о которой нужно знать
OpenAI оставляет за собой право понижать запросы Fast mode до Standard, когда трафик растёт слишком быстро. Конкретно: если суммарный трафик превышает 1M TPM и при этом вырастает более чем на 50% за 15 минут, часть запросов Fast/Priority может быть обработана с приоритетом Standard и оплачена по тарифу Standard. В ответе будет указано service_tier: "default", так что это можно отследить программно.
Это защита от пакетных всплесков, а не штраф за нормальное интерактивное использование. Но если у вашего продукта бывают вирусные моменты, когда нагрузка за четверть часа вырастает в 2-3 раза, будьте готовы к тому, что часть «быстрых» запросов тихо понизится. Закладывайте это заранее: отслеживайте возвращаемый service_tier и настройте оповещение, когда он сменяется на "default".
Codex и расширения «pi»
Один из самых заметных сценариев для Fast mode — OpenAI Codex. Для пользователей с подпиской ChatGPT (OAuth) сторонние расширения «pi» (например, pi-openai-fast, pi-codex-fast) подставляют { "service_tier": "priority" } в подходящие запросы Codex и тем самым включают Fast mode для gpt-5.6-sol, gpt-5.6-terra и gpt-5.6-luna при авторизации через ChatGPT. Подстановка срабатывает, только если провайдер — openai-codex, API — путь Responses, модель — поддерживаемый вариант GPT-5.x, а в теле запроса ещё нет service_tier.
Если вы авторизуетесь по API-ключу, а не через ChatGPT OAuth, расширение не нужно — просто передавайте service_tier сами.
Fast mode через TeamoRouter
OpenAI-совместимый эндпоинт TeamoRouter поддерживает тот же параметр, поэтому в коде меняются только base URL и ключ:
from openai import OpenAI
client = OpenAI(
api_key="tr-your-key-here",
base_url="https://api.teamorouter.com/v1",
)
resp = client.responses.create(
model="gpt-5.6-sol",
input="Write a Fast mode activation check for our agent pipeline.",
service_tier="fast",
)
print(resp.output_text)
То же самое для Chat Completions:
resp = client.chat.completions.create(
model="gpt-5.6-sol",
messages=[{"role": "user", "content": "Give me a one-line summary of Fast mode."}],
service_tier="fast",
)
print(resp.choices[0].message.content)
Шлюз передаёт service_tier без изменений, поэтому Fast mode, значения по умолчанию для проекта и старое значение "priority" ведут себя точно так же, как при прямом обращении к OpenAI, — но вы платите по сниженным тарифам TeamoRouter и можете под одним ключом маршрутизировать GPT-5.6 Sol наравне с Claude, Gemini и DeepSeek. Именно это сочетание делает стратегию «Fast mode для интерактива, Standard или Flash для всего остального» практичной: уровень для каждого запроса выбирает маршрутизатор, а не вы правкой кода.
Разумная стратегия маршрутизации
Самая выгодная схема в 2026 году — многоуровневая, а не «всё в Fast»:
| Слой | Модель и режим | Почему |
|---|---|---|
| Интерактивный помощник | GPT-5.6 Sol, Fast mode | Человек ждёт, нужна стабильность |
| Исполнение агентов | DeepSeek V4 Flash (или V4 Pro для планирования) | Большие объёмы, важна стоимость |
| Пакетные задания / эвалы | Уровень Standard или дешёвая модель | Офлайн, задержка не важна |
| Ревью и архитектура | Claude Opus 4.8 или V4 Pro | Глубина важнее задержки |
Agentic Routing в TeamoRouter позволяет описать именно такую схему: маршрутизировать по типу задачи, задать веса задержки для интерактивного пути, а всё остальное отдать правилам с весами по стоимости. Одна интеграция, один счёт — и Fast mode срабатывает только там, где действительно ждёт человек.
Итог
Fast mode в GPT 5.6 Sol — аккуратный и адекватный по цене ответ на реальную проблему: задержку интерактивного ИИ. Это не более умная модель — это та же модель с приоритетной полосой и ценником 2x. Включайте его там, где ждут люди, пропускайте там, где не ждут, а объёмную работу отправляйте на модели подешевле. service_tier: "fast" (и старое "priority") поддерживается в TeamoRouter идентично, так что вы получаете гарантию по задержке без мороки с интеграцией — один ключ и для быстрой полосы, и для дешёвой.
FAQ
В чём разница между Priority и Fast mode?
Функционально — ни в чём. 30 июля 2026 года OpenAI переименовала «Priority processing» в «Fast mode». Оба названия соответствуют одному и тому же уровню обслуживания; старое значение service_tier: "priority" по-прежнему принимается.
Сколько стоит Fast mode?
Примерно в 2 раза дороже тарифа Standard на токены. Для GPT-5.6 Sol с ценой $5/$30 за миллион токенов Fast mode фактически обходится в ~$10/$60 за миллион токенов.
Меняет ли Fast mode качество ответов?
Нет. Это апгрейд только задержки и приоритета — та же модель, тот же интеллект, те же ответы.
Стоит ли Fast mode своих денег в Codex?
Для интерактивного программирования, где вы ждёте каждый шаг агента, — да: первые тесты показывают реальное ускорение ~1.5-1.6 раза, а накопительный эффект на многошаговых агентных прогонах велик. Для пакетной работы — нет.
Можно ли использовать Fast mode через TeamoRouter?
Да. Передавайте service_tier: "fast" в OpenAI-совместимый эндпоинт TeamoRouter (https://api.teamorouter.com/v1) точно так же, как в OpenAI, — с тем же доступом по одному ключу ко всем остальным моделям.