【本网讯】周二,OpenAI在Anthropic发布其新旗舰模型Claude Opus 5.5仅仅数分钟后,推出了两款新模型GPT-6 Sol与GPT-6 Luna。这一举措被视为对竞争对手的直接回应。
据悉,Sol与Luna定位低于今年9月3日发布的GPT-6 Astra,后者被OpenAI称为“全球最智能且对齐的模型”。Astra仍面向最艰巨任务,而Sol和Luna则是为日常工作环境设计的更便宜、更快速选项。
Myriad:下一家IPO的公司是谁?点击做出你的预测。
此举与Anthropic的策略高度相似。若将模型对标,Astra相当于Fable,Sol相当于Opus,Terra相当于Sonnet,而Luna在升级后相当于Haiku。OpenAI同时调整了价格以保持竞争力:两款模型的API调用费用较GPT-5.6推广期每令牌价格降低50%。令牌是模型读写文本的基本单位,通常略短于单词,企业按百万令牌付费。
具体而言,Sol现定价为每百万输入令牌2美元、输出令牌10美元,此前为4美元和20美元;Luna降至0.10美元和0.50美元,此前为0.20美元和1.20美元。整体而言,OpenAI各档价格均低于Anthropic。
性能方面,依据Zapier构建的AutomationBench基准测试(评估AI代理使用47种工具执行完整业务工作流的能力,通过率计分),GPT-6 Sol在最高推理设置下得分33.2%,单次任务成本0.27美元。据OpenAI数据,Claude Opus 5同等设置得分26.9%,但单次任务成本高逾11倍。Sol亦在此测试中略胜Anthropic更贵的旗舰Claude Fable 5.1。
在评估长周期经济价值工作的Agents' Last Exam中,GPT-6 Sol最高努力度得分56.4%,OpenAI称其以低60%的单次任务成本超越Claude Opus 5最佳成绩。推理努力度是OpenAI新增旋钮,调高后模型会花费更多计算双重检查答案,精度与成本同增。
计算机操作方面,在OSWorld 2.0测试中(模拟人工点击、输入导航软件),GPT-6 Sol以约80%的低成本取得60.5%得分,逼近Claude Opus 5中等努力度的60.3%。
目前,GPT-6 Sol与Luna已向ChatGPT Work和Codex的Plus、Pro、Business、Enterprise及Edu订阅用户开放,Luna亦通过桌面应用覆盖免费及Go用户。两款模型尚未进入普通ChatGPT应用,OpenAI表示将在全天逐步推出以保障服务稳定。
