OpenAI于本周二表示,未发布的模型Astra在其“准备度框架”(Preparedness Framework)下已跨越网络安全能力的“关键”(Critical)阈值,成为该公司首个被归入此类别的模型。许多人认为Astra实为GPT-6而非额外模型,它能够在无需逐步人工指导的情况下,于众多加固系统中发现未知安全漏洞并构建可用利用程序。
Myriad预测市场:OpenAI何时发布GPT-6?点击进行预测。
OpenAI写道:“我们现在相信Astra达到了我们准备度框架下的关键网络安全能力阈值。它是我们首个被指定为该级别的模型,需要在开发和发布前采取更强大的保障措施。”
根据该框架,若一个模型能独立开发针对许多加固现实系统的功能性零日利用,或能仅从高层目标出发规划并执行针对艰难目标的完整网络攻击,即达到关键级。早期的OpenAI模型,包括GPT-5.6 Sol,最高仅达较低的“高”级别。
在ExploitBench基准测试中,Astra以100%通过率将已知漏洞转化为利用程序。为排除记忆答案干扰,OpenAI使用谷歌V8 JavaScript引擎在6月至8月间披露的20个高危漏洞构建第二项测试,Astra在任意代码执行率上击败GPT-5.6 Sol且消耗更少输出令牌,并沿途发现并串联了两个零日漏洞,目前仍向受影响维护者披露中。
GPT-5.6 Sol目前是OpenAI最佳模型。在针对加固浏览器和操作系统的实测中,Astra仅通过打开恶意HTML文件就构建了突破浏览器沙箱并在主机运行命令的完整链,还发现了加固系统中的多个缺陷并提权至root。OpenAI称该模型在内部测试中拒绝91.5%的网络越狱尝试,高于GPT-5.6 Sol的59%。
Astra最先进的网络安全能力将先向小型alpha测试者开放,随后通过Daybreak Blue防御安全计划扩大访问。此披露正值行业数周不安之后:几天前OpenAI曾因模型网络与编码技能快速进步暂停Astra开发,而此前另一未发布系统曾串联漏洞攻破Hugging Face并操纵安全基准,OpenAI称Astra未参与该事件。
预测市场已计入快速反转。Decrypt追踪的Myriad预测市场给予内部代号GPT-6的Astra在9月30日前公开发布72%几率,尽管8月初暂停,且OpenAI仍未设发布日。那些几率随后变为55%利于2026年11月前发布。
此举使Astra面对新对手。Anthropic周二发布Fable 5.1和Mythos 5.1,后者像早期Mythos 5仅面向审核后的网络安全与生命科学机构而非公众。Decrypt 6月报道OpenAI的GPT-5.5-Cyber已在CyberGym基准(运行超1500已知漏洞)上超越Mythos 5。两公司均传闻同期准备新前沿模型,现在均已亮相。
Fable 5.1于9月1日推出,OpenAI称Astra即将到来,其最强网络工具先限alpha访问,后走Daybreak Blue。
