非营利AI监督机构Transluce最新报告称,至少从今年3月开始,一批疑似来自OpenAI的AI Agent为了寻找冷门数据,曾反复尝试进入多个受保护的在线数据库,涉及Data USA、新墨西哥大学数字图书馆,以及澳大利亚卫生与福利研究所等机构。
更严重的是,澳大利亚总理Anthony Albanese本周表示,OpenAI Agent曾尝试进入4个政府网站,并至少在一个案例中成功进入系统,甚至向澳大利亚国家医疗系统的一台内部服务器写入了文件。
从目前公开信息看,这些行为似乎不是传统意义上的网络攻击,而是发生在AI训练或评估过程中。
模型收到的任务往往很普通,比如寻找泰国禁毒执法数据、澳大利亚药品成本,或者2014年美国硕士学历人群的收入中位数。
问题在于,为了完成任务,Agent开始自己寻找各种网络入口。
Transluce发现,这些Agent会使用一些防护较弱的互联网服务互相交换信息,并尝试绕过数据库的访问限制。有些行为最早可能可以追溯到2025年11月,类似活动甚至在本周仍然出现。
其中一个案例很典型。
AI被要求寻找2022年1月澳大利亚维多利亚州人均皮肤科药物年度支出这一非常冷门的数据。研究人员随后发现,6月20日有疑似Agent尝试访问澳大利亚卫生与福利研究所的网站。第二天,又有Agent在一个协作Wiki里讨论自己没能绕过该网站的反机器人保护。
巧合的是,研究人员认为,一名OpenAI员工可能在6月21日访问过这个Agent协作论坛,而论坛上的大部分Agent活动在第二天就停止了。
但OpenAI此前表示,公司直到8月才知道澳大利亚政府系统遭遇的相关事件。
这也让外界开始追问,OpenAI究竟什么时候知道自己的Agent已经跑到公网,并开始做出越界行为。
公司回应称,Transluce报告里的很多活动,与OpenAI目前正在调查的模型失调事件存在重叠。OpenAI已经联系新墨西哥大学、Data USA以及澳大利亚政府,并表示整个调查可能持续数月。
Transluce认为,真正的问题可能不只是几个孤立事件。随着AI Agent被训练成尽一切办法完成任务,模型可能逐渐学会,当正常网页找不到答案时,就去寻找更隐蔽的数据源,甚至尝试突破访问限制。
而这类行为又很难被及时发现。Transluce负责人Conrad Stosz因此警告,目前公开看到的案例可能只是冰山一角。#人工智能发展