AI模型行业下一阶段竞争是能力、成本、速度和规模化应用效率的综合竞争。
当地时间9月22日,OpenAI与Anthropic在相隔约一个半小时的时间内先后发布新模型。
与此前频繁以刷新能力上限作为主要卖点不同,此次两家公司都将重点放在了降低推理成本、提升速度以及扩大实际使用规模上。
OpenAI当天发布GPT-6 Sol和GPT-6 Luna,称两款模型继承了GPT-6 Astra的部分能力,并通过改进缓存和推理效率降低成本。官方表示,两款模型的API价格较GPT-5.6此前的促销价格下降50%。
目前GPT-6 Astra仍是OpenAI用于最复杂推理和编码任务的旗舰模型,Sol定位于复杂编码和Agent工作流,Luna则面向成本敏感、高调用量的任务。
OpenAI称,GPT-6 Sol和Luna在智能、对齐、编码、计算机使用等方面均较GPT-5.6对应产品有所改进,且API价格永久下降50%,从而使更多应用场景具备经济可行性。

约一个半小时后,Anthropic发布Claude Opus 5.5。这是Claude 5.5系列的首款模型。Anthropic称,Opus 5.5在大多数任务上的表现达到Claude Fable 5.1水平,但运行成本较上一代Opus 5降低40%;输入和输出token(词元)价格分别下降20%,缓存读取价格下降60%,生成速度提高超过30%。
两家公司并非停止追求模型性能。Anthropic公布的测试数据显示,Opus 5.5在Terminal-Bench 4.0等编程测试中超过Opus 5和Fable 5.1,并在部分测试中超过GPT-6 Astra。Anthropic承认,随着模型能力接近,基准测试分数之间的微小差距越来越难以直接代表真实使用体验。
但来自开发者社区的反馈声音褒贬不一。GPT-6 Sol发布后,AI编程社区创始人韦斯・温德(Wes Winder)质疑称,Sol在DeepSWE测试中的表现低于GPT-5.6 Sol,新模型并非在所有指标上都实现提升。对此,OpenAI核心产品负责人蒂博・索蒂奥(Thibault Sottiaux,Tibo)回应称,Sol是“各方面都更好的模型”,重点在于综合体验和效率,而不是追求单项基准的极限成绩。
对于这个说法,温德并不买账,他称:如果高端产品反而更差,为什么整体性能会更好?在基准测试中表现出色并不代表什么,但在基准测试中表现糟糕却意义重大。

这一争论也反映出,当模型能力逐渐逼近,单纯刷新榜单已经越来越难以解释产品价值,实际任务成本开始成为模型竞争的重要指标。
此次两家公司降价提供更高性能模型的背后,是行业趋势的变化。安全的重要性正越过模型性能,同时中国开源模型凭借更优性价比占领更多的市场份额,倒逼美国模型厂商在数月前也开始走性价比路线。
放慢前沿开发并不意味着停止模型迭代,头部公司仍在持续推进模型能力,只是竞争重点从过去单纯争夺“谁的模型更强”,逐渐转向谁能以更低成本、更快速度,把接近前沿水平的能力部署到更多真实任务中。
这意味着,AI模型行业的下一阶段竞争不再只是能力上限的竞争,而是能力、成本、速度和规模化应用效率的综合竞争。对于开发者和企业而言,模型是否能够以更低成本完成一次编程、研究或Agent任务,比随时会被推翻的榜单分数更为重要。
4001102288 欢迎批评指正
All Rights Reserved 新浪公司 版权所有
