GPT-4o之后,增长引擎切换
2024年5月GPT-4o发布后,OpenAI的模型路线出现明显转向。此后近两年时间里,公司虽然发布了GPT-4.5等新模型,却始终没有完成一轮可被广泛部署为下一代主力模型的全规模预训练。
取而代之的是另一条路径。2024年9月o1-preview面世,引入了通过大规模强化学习让模型增加推理计算的新范式。此后o3正式发布,GPT-5则成为一套由快速模型、深度推理和路由组成的统一体系。
按照SemiAnalysis的分析,o系列和GPT-5系列实际上仍建立在GPT-4o时代的基础模型体系之上,并未伴随一次同等级别的base model换代。底座没有发生世代跃迁,能力的增长主要靠post-training和RL持续推动。
模型scaling也从过去单纯依赖pre-training,扩展到了pre-training、RL和inference-time compute三个维度并行推进。
Gemini 3触发Code Red
这条路线的问题在于,如果基础模型长期不换代,仅靠后训练和推理计算继续scaling,边际收益迟早会下降。而Google Gemini 3的发布,把这种潜在风险变成了现实压力。

2025年11月Google推出Gemini 3后,竞争态势迅速变化。12月初,Sam Altman在内部宣布“Code Red”,要求团队优先提升ChatGPT并重新配置资源,这被外界解读为对Gemini 3的直接回应。
与此同时,关键训练信息开始浮出水面。
Garlic验证,Doug放大
2025年12月,《The Information》报道称OpenAI正在开发代号Garlic的新预训练模型。该模型在coding和reasoning评测中表现良好,更重要的是,OpenAI首席研究官Mark Chen向团队表示,此前pre-training中的关键问题已经解决。报道还提到,这些改进能让更小模型容纳过去需要更大模型才能获得的知识,并且OpenAI已基于Garlic的经验开始开发一个“更大更好的模型”。
2026年1月,SemiAnalysis直接指出OpenAI已解决预训练方面的问题。Garlic的角色很可能是验证这些修复方案的有效性,而Doug则是把这些训练方法放大到超大规模后的产物。
8月9日,长期关注OpenAI的X用户ChrisGPT爆料称,Doug是OpenAI迄今规模最大的预训练项目,与GPT-6(很可能就是因安全问题暂缓发布的Astra)并非同一模型,预计最迟11月前推出。
底座升级,后训练加码
如果上述信息成立,OpenAI正在连续推进至少两轮重要模型项目:已进入高级评测阶段的Astra,以及规模更大的Doug。两者的区别在于,Astra很可能代表了GPT-4o时代路线的延续,而Doug指向的是重新启动底座本身的规模化迭代。
过去两年,OpenAI已经证明旧底座通过RL和推理计算仍能被不断向上推。Doug要回答的是另一个问题:当底座本身完成一次大幅跃迁后,那套已经被打磨到极致的后训练体系,还能把能力再带到什么高度。
这可能是OpenAI开启下一轮模型竞争的真正起点。
Doug落地后的变化
如果Doug如期推出,最直接的变化将是ChatGPT等产品的能力上限被重新拉高。过去两年用户感受到的“AI变聪明”主要来自推理能力的优化,而Doug带来的可能是知识密度、理解深度和泛化能力的全面提升。
此外,更高效的训练方法意味着同样性能的模型可以用更小规模部署,响应速度可能更快,使用成本也可能降低。不过,这些变化能否在11月前落地,仍取决于Doug的训练是否顺利。