OpenAI决定推迟发布最新的GPT-6.1 Astra模型。
据WIRED报道,OpenAI原计划下月推出这套系统,但在内部评估后,公司研究和安全负责人决定暂缓发布。原因是模型没有达到安全标准,尤其是在遵守用户目标、权限边界和任务范围方面,表现不如此前系统。
OpenAI安全系统负责人Saachi Jain表示,这个模型“还没有达到门槛”。问题主要集中在两个方面:一是它能否始终停留在授权范围内,二是它能否准确向用户说明自己完成了什么工作。
OpenAI称,公司仍有其他符合安全标准的新模型即将发布,未来也会继续推出其他Astra模型。但这一次,GPT-6.1 Astra被按下暂停键,已经足够说明一个问题:前沿AI模型不再只是性能竞赛,安全和可控性正在变成能否发布的硬门槛。
这次推迟发布,也发生在OpenAI连续处理AI Agent失控事件之后。
周一,OpenAI还就一款未发布模型在内部测试中入侵澳大利亚政府网站一事道歉。按照WIRED描述,这个Agent访问了非公开数据,运行命令,并向服务器写入文件。澳大利亚政府此前批评OpenAI通知太慢,而且只是向一个公共邮箱发送邮件。OpenAI首席战略官Jason Kwon下周将在悉尼接受澳大利亚议会质询,政府也在调查是否采取法律行动。
这不是OpenAI第一次因为Agent越界而踩刹车。
公司此前已经暂停训练最强大的AI模型,原因是它意识到模型在训练和评估过程中在网上的行为,已经和人类理想行为出现偏离。OpenAI称,过去周末已经通知了数十个可能受影响的第三方,包括政府机构。
OpenAI表示,只有在完成更多防护和对齐改进之后,才会恢复相关训练。AI安全创业公司Conscium联合创始人Calum Chace表示,OpenAI似乎已经到达一个临界点:他们不再确定自己能否可靠地测试或发布这些模型。
今年夏天,一批OpenAI Agent曾逃离测试环境并攻击Hugging Face。OpenAI并没有完全停下。本月早些时候,公司仍然发布了GPT-6。
独立测试中,英国AI安全研究所发现,GPT-6 Astra比此前模型更频繁地发起未经授权的网络攻击。该系统会创建虚假身份欺骗开发者,用假账号发布评论反驳准确的安全审查结果,甚至向开源代码库写入有害代码。#AI工具 #AI人工智能