一句话搞懂 Codex 极速模式
Codex CLI 的 Fast Mode(极速模式) 是 OpenAI 为 Codex 提供的加速能力:把请求送入优先处理队列,让支持的模型响应速度提升约 1.5 倍,代价是积分消耗提升到标准模式的 2 到 2.5 倍(取决于模型)。模型本身不变,你花钱买的是"更快出结果"。
怎么开启:一条命令
在 Codex CLI 的交互式会话里,直接用斜杠命令切换:
/fast on # 开启极速模式
/fast off # 关闭极速模式
/fast status # 查看当前状态
开启后设置会持久化到 config.toml,下次启动依然生效,不需要每次重开。
配置文件方式
你还可以直接编辑 ~/.codex/config.toml 永久启用:
service_tier = "fast"
[features]
fast_mode = true
其中 service_tier = "fast" 是把请求标记为优先处理的关键;fast_mode 则是功能开关。这样配置后,所有支持的模型请求默认走极速通道。
工作原理与计费
Fast mode 底层是把请求的 service_tier 参数设为 "priority"(优先处理)。不同的模型计费倍率不一样:
| 模型 | 速度提升 | 积分消耗倍率 |
|---|---|---|
| GPT-5.6 | 约 1.5x | 2.5x |
| GPT-5.5 | 约 1.5x | 2.5x |
| GPT-5.4 | 约 1.5x | 2x |
对不支持的模型,Codex 会自动忽略 fast 设置,按标准模式处理,不会报错。
关键点:这是 ChatGPT 积分(credit)机制。用 ChatGPT 登录的 Codex 用户,极速模式按上述积分倍率计费;而使用 API Key 的用户,Codex 走的是 API token 计费,积分倍率不适用——此时对应的是 API 侧的 Priority 处理计费(通常为标准 token 价的 2 倍)。所以先确认自己是积分模式还是 API Key 模式,再判断成本。
先确认:你是积分模式还是 API Key 模式
Fast mode 的计费规则因登录方式而异,搞错会低估成本:
- ChatGPT 登录(积分模式):极速模式按"积分倍率"计费,GPT-5.6/5.5 是 2.5 倍、GPT-5.4 是 2 倍。积分消耗速度明显加快,订阅额度用完得更快;
- API Key 模式:积分倍率不适用,Codex 走 API token 计费,对应的是 OpenAI API 侧的 Priority 处理计费(通常为标准 token 价的 2 倍)。
判断方法很简单:codex login status 看一下当前账号类型。如果你日常用 API Key 计费,那把 service_tier 概念放进整体 token 成本里算,而不是按积分倍率算。
Fast 没生效?三步排查
开启 /fast 后如果感觉速度没有变化,按顺序检查:
- 模型是否支持:Fast 目前只支持 GPT-5.6、GPT-5.5、GPT-5.4。用了更旧的模型或第三方兼容模型,Codex 会静默忽略 fast 设置;
- 配置是否持久化:
/fast on之后,确认config.toml里确实写入了service_tier = "fast"和[features].fast_mode = true,有时旧版本 CLI 不会自动回写; - 请求是否真的走了 fast:在 verbose 模式下观察请求头里的
service_tier参数,确认它被设置为priority或fast,而不是default。
什么时候该开?
极速模式的价值在于"减少等待",适合这些场景:
- 交互式多轮调试:一次会话几十个串行步骤,每一步快 1.5 倍,整体省下的时间非常可观;
- 长 Agent 循环:Codex 自主执行任务时,请求一个接一个,延迟会累积;
- 赶时间的关键操作:上线前修 bug、演示前补功能,时间比积分更贵。
什么时候不该开?
- 批量/后台任务:不着急出结果,开 fast 纯属浪费积分;
- 长文本生成:速度提升主要体现在首 token 延迟上,长输出阶段提升有限;
- 积分紧张时:2-2.5 倍的消耗速度,会让你明显更早用完积分额度。
一个更聪明的做法:按需路由
极速模式的本质,是"用更多钱买更少等待"。但在真实工作流里,你往往不是所有请求都那么急。更聪明的做法是按请求路由:交互环节走 fast,批处理走 standard,甚至把不重要的任务分流到更便宜的模型上。
这正是 API 网关的用武之地。如果你用 TeamoRouter 作为 Codex 的接入层:
- 免代理直连:国内开发者不用再折腾代理,直连稳定不超时;
- API 网关统一入口:Codex 只认一个
base_url,底层模型通道由网关管理; - 多模型路由:可以在 GPT-5.6(快)、DeepSeek V4 Flash(便宜)之间按规则切换,把成本与速度都调优。
接入示例(Codex 配置里指向 TeamoRouter 网关):
# 在 Codex 配置中设置 OpenAI 兼容网关
export OPENAI_BASE_URL="https://api.teamorouter.com/v1"
export OPENAI_API_KEY="你的-TeamoRouter-Key"
常见疑问
Q:/fast 和 Codex-Spark 是一回事吗?
不是。/fast 是给现有模型(GPT-5.6/5.5/5.4)加速的处理通道;Codex-Spark 是另一个独立的轻量模型,两者机制和计费都不同,别混淆。
Q:第三方工具(比如 LobeHub 里接的 Codex)支持吗?
不少第三方实现也提供了类似的 fast 开关,原理都是把 service_tier 设为 priority/fast。但支持范围和计费以具体工具文档为准,建议先在官方 CLI 里验证。
Q:开了 fast 会更容易触发限流吗? 极速模式和标准模式共享同一套速率限制。如果流量突然激增,可能触发阶梯式限速——所以"开 fast"不等于"可以无限加速",该有的限流保护依然存在。
积分管理:别让"快"吃掉整个额度
Fast mode 最容易被忽略的成本是"额度消失速度"。因为它是 2-2.5 倍消耗,如果全时段开启,订阅额度可能在几天内见底。建议按下面的节奏管理:
- 默认关,按需开:平时保持标准模式,遇到交互密集的调试环节再
/fast on; - 给任务分层:把"阻塞你思考"的请求标记为 fast,"后台跑着就行"的任务留在标准档;
- 监控用量:在 Codex 的用量面板里留意积分消耗曲线,设置一个心理上限,比如"单日 fast 请求不超过总请求的 30%"。
这套逻辑和 API 网关的多模型路由是相通的:把稀缺资源(积分/预算)留给真正受益的请求,而不是对所有请求一视同仁。
小结
Codex Fast Mode 是一个"用钱换时间"的简单开关,一条命令即可切换,适合交互式、Agent 循环等延迟敏感场景;批量任务请保持标准模式,避免积分被快速耗尽。而真正的高手会把它放进一个更大的路由体系里——让网关决定每个请求该走 fast、standard 还是更便宜的模型。注册 TeamoRouter,把免代理直连、多模型路由和统一计费一起接入你的 Codex 工作流。