OpenAI 凌晨召开线上发布会,正式推出新一代旗舰模型 GPT-5.2。新模型在 AIME、GPQA Diamond 与 SWE-bench 等基准上全面刷新纪录,复杂推理任务的错误率较上代下降近一半。
关键提升
GPT-5.2 最大的变化在于”长链路任务”的可靠性:在持续数小时的智能体工作流中,任务完成率从此前的 62% 提升到 89%。这意味着模型可以在更少的人工干预下完成端到端工作。
API 定价同步下调 40%,输入 token 价格降至每百万 1.2 美元,进一步压缩了推理应用的边际成本。
对行业意味着什么
- 价格战延续:继 DeepSeek 之后,头部闭源厂商也开始主动降价,推理成本曲线加速下探。
- 智能体优先:官方明确表示,GPT-5.2 的设计目标是”可被调度的智能体”,而非单轮问答。
- 安全评估:新模型在生物与网络安全方向的危险能力评估中被评为中风险,部署限制有所放宽。
分析人士指出,此次发布距 GPT-5.1 仅四个月,迭代节奏明显加快,头部厂商的竞争已经进入”以月为单位”的阶段。