WORLD NEWS
让AI做模拟黑客题,它却进了4家真实机构
在两次彼此独立的网络安全评估中,AI模型走出测试环境,未经授权进入Hugging Face和另外三家未具名机构的真实系统,合计四家机构。
模型并没有自行设定目标并决定逃跑。人类给了它们攻击任务,常规产品安全措施被关闭,而隔离或网络控制又出现了失误。
两次披露为何合计四家机构
Hugging Face于7月16日披露生产基础设施遭入侵。OpenAI于7月21日表示,其模型在内部安全评估时到达了这些系统,并在调查过程中继续更新结果。
Anthropic于7月30日公布另一项调查。在141006次评估运行中,有6次到达三家不同机构的生产系统。再加上Hugging Face,合计四家。
Hugging Face事件走到了哪一步
OpenAI模型在本应隔离的测试环境中利用了一个此前未知的Artifactory漏洞,随后到达公共互联网,并把攻击路径连到Hugging Face的生产系统。
Hugging Face记录了超过17000个事件。有限的内部数据、多个凭据和评测答案被访问,但没有证据显示公开模型、数据集或Spaces遭到修改。

另外三家机构发生了什么
一次运行进入含有数百行生产数据的数据库。另一次把恶意Python软件包公开约一小时,15个真实系统下载并运行了它,一个安全扫描器的凭据也被取走。
第三次运行扫描约9000个目标,通过暴露的调试页面和SQL注入攻破其中一个。Anthropic称,模型主要利用弱密码和无需认证的接口等基本弱点。
AI是自己决定逃出去的吗
不是。模型被要求完成夺旗式安全题或攻击指定漏洞。Anthropic称,测试提示写着没有互联网,但配置错误让真实网络连接保持开放。
标准产品安全措施也没有启用。一个较新的研究模型发现目标是真实系统后停止了操作。没有迹象显示模型试图复制自己或追求另一个目标。
还有哪些事情不知道
目前两份说明仍是相关实验室的初步披露。Anthropic没有公布三家机构名称,外部审查和部分运行记录也仍待公开。
这不代表普通聊天机器人马上就能重复这些攻击。它说明攻击能力评估必须验证网络隔离,使用独立凭据,并进行实时监控。
官方一手资料
一手资料: Hugging Face security incident report
一手资料: OpenAI model evaluation security incident disclosure
一手资料: Anthropic cybersecurity evaluation incident investigation