OpenAI 史上最快的模型,死了。Codex 负责人 Tibo 发帖宣布,GPT-5.3-Codex-Spark 下周退役。这款每秒 1200 个 Token、OpenAI 第一个逃离英伟达的模型、750 兆瓦 Cerebras 大单的第一份交付,从发布到下线只活了 7 个月。Tibo 给的理由很简单:用量一直在往下掉,手上也已经有明显更好的模型了,“是时候给未来腾地方了”。他还补了一刀:“真不敢相信,我们居然发布过名字这么长的模型!!”
从“未来”到边缘化,败在“降智提速”
今年 2 月 12 日 Spark 上线时排场盛大:这是 OpenAI 第一个专为实时编程设计的模型,128k 上下文,每秒生成超过 1000 个 Token,官方称往返开销降 80%、首 Token 延迟砍半。它还是 OpenAI 第一个跑在英伟达技术栈之外的生产模型,底层算力来自 Cerebras 的晶圆级芯片 WSE-3,标志着那份 750 兆瓦、总价值超 200 亿美元算力大单交出了第一份答卷。
但热度退得比涨得更快。Spark 的致命伤在于,一块晶圆装不下旗舰模型,它本质上是一个为极致速度而妥协的“蒸馏版小模型”:Terminal-Bench 2.0 评测中仅 58.4%,远低于完整版 GPT-5.3-Codex 的 77.3%;SWE-Bench Pro 曲线显示它虽能把任务压到 1 至 2 分钟,准确率却停在 47% 至 51%,而完整版从 3 分钟的 51% 可拉到 16 分钟的 57%。宣传中的“15 倍提速”也被拆穿——同等准确率下其实只快 1.37 倍。开发者吐槽它凭空捏造 API 端点、JSON 格式不稳定,培训机构 Turing College 的总结一针见血:“没有智能的速度,只是更快地失败。”
真正给 Spark 判死刑的是 8 月 13 日 Cerebras 发布的 Ultrafast 模式:跑在晶圆上的不再是缩水版,而是旗舰模型 GPT-5.6 Sol 本尊。通过将旗舰模型按层切分、铺设在多台 CS-3 节点上形成流水线,Ultrafast 在“与标准版同等智能”前提下飙出每秒 750 个 Token——同一任务标准档平均 7.7 分钟,Ultrafast 仅 83 秒,端到端快 5.6 倍。Cerebras CEO Andrew Feldman 称:“速度与智能,不再互斥。”
速度从“专属模型”变成“付费档位”
Spark 并非唯一被清理的历史包袱。过去三个月 OpenAI 模型库经历激进换血:6 月 2 日 GPT-5.2 与 GPT-5.3-Codex 退役,8 月 31 日 GPT-5.4 与 5.4 Mini 退役、用户整体迁移至 5.6 世代,9 月 11 日轮到 GPT-5.3-Codex-Spark。伴随旧世代离场,Codex 迎来了 Sol、Terra、Luna、Astra 的全新命名纪元。
更深层的逻辑更迭在于,“快”正从一个独立的专用模型,演变为旗舰模型的一项标配档位——就像推理强度分为 Light 到 Max,速度也从 Standard、Priority 排到 Ultrafast,按档付费的商业模式已经跑通。回头看,Spark 作为过渡期的探路者,证明了 Cerebras 晶圆足以扛住生产级流量、推理任务可以脱离英伟达生态运行;当探路结束、大部队入驻,探路者的使命也就自然终结。下一轮竞赛比的不再是谁能做出最快的阉割版模型,而是谁能把最强的旗舰模型跑出最极限的速度。