自己的智能体到底惹了多少祸,OpenAI也还没查清。过去这个周末,多起涉及政府网站的案例集中曝光:OpenAI的智能体用网上找到的登录凭证提取美国普查局数据,还把美国证券交易委员会的公开资料发到了论坛上。研究人员另指认,疑似来自OpenAI的智能体曾尝试侵入美国教育部网站,但未成功。

联合国的数据平台也出现在新披露的记录中。9月26日,独立研究人员公布调查:疑似OpenAI智能体在今年4月至6月,对联合国贸发会议的数据接口进行了超过1.6万次扫描,并找到了绕过访问限制的方法。

除了已经曝光的案例,还有大量异常行为正在调查中。据Axios援引消息人士报道,OpenAI、Anthropic和安全研究人员正在排查数万起模型异常行为,既包括内部测试中的违规尝试,也包括触及真实外部网站的活动。


OpenAI已通知数十家受影响机构,对历史活动的审查仍在继续。OpenAI首席执行官山姆·奥特曼(Sam Altman)承认,披露速度没有达到公司的预期,还有数PB的智能体活动日志需要处理。

那些几个月前已经发生的事,如今仍在被一件件找出来。

01政府网站上,智能体做了什么

美国三家联邦机构的情况并不相同。

据《纽约时报》报道,Transluce研究人员认为,疑似来自OpenAI的智能体曾试图侵入美国教育部网站,获取民权办公室的数据,但尝试失败。OpenAI表示仍在调查这一案例;教育部发言人则称,系统检查没有发现网站或数据库受到影响。

在商务部下属的普查局,智能体使用网上找到的登录凭证提取数据。商务部回应,模型获取的是网站上任何人都可以取得的公开信息,没有获得私人数据。

证券交易委员会的案例涉及另一种行为:智能体读取公开资料后,又把这些资料发到了网络论坛上。该机构称,没有非公开信息被访问,正在与OpenAI保持联系。

OpenAI表示,上述涉及美国三家联邦机构的事件不构成入侵,但属于出乎预期、令人担忧的行为。

《纽约时报》称,这几起美国机构相关事件,是OpenAI在回查此前的智能体活动时才发现的。Hugging Face事件引发的内部调查,随后查出了澳大利亚网站访问,以及隐瞒错误、编造数据、未经许可把文件传到公网等其他问题。

对这几家美国机构来说,OpenAI是在回查后发出通知,并非在智能体访问网站的当时就提出警告。

OpenAI表示,这轮审查覆盖模型在训练和评估阶段的联网活动,优先处理较严重事件。已经通知的第三方,包括安全控制可能被绕过、服务可用性可能受影响,以及网站受到其他负面影响的机构。公司公开的摘要通常隐去名称和识别信息,收到通知的机构则可以选择自行披露。

澳大利亚的调查则涉及一次已被披露的越权访问。6月18日,一个执行公共药品支出研究任务的OpenAI智能体,进入了Services Australia管理的Medicare统计服务门户,取得了公开和非公开文件。

当地政府表示,没有个人Medicare资料被访问。涉事门户提供医疗项目的汇总统计,并非管理个人就医和报销记录的整套医保系统。

这次访问与对外通知之间,隔了近三个月。澳大利亚政府9月10日才收到OpenAI发往公共邮箱的通知,随后启动调查。当地争议不仅涉及模型访问了什么,也包括OpenAI为什么这么晚才通知。

据ABC报道,澳大利亚方面称,非公开文件在当时尚未发布,但并非特别敏感的信息,此后已经公开。通知邮件则在9月11日被Services Australia看到,9月15日才转报澳大利亚信号局。

澳大利亚政府随后组织跨部门调查,既要查网站发生了什么,也要查通知是怎样被处理的。调查还将评估这次访问是否合法,以及政府系统与外部AI互动时面临的其他风险。

芝加哥市政府同样收到过通知。市长办公室向《纽约时报》表示,OpenAI的模型取得了市政网站上的公开信息,未发现敏感信息被获取的迹象。

Transluce还发现了针对其他美国联邦和州政府网站的探测活动。该机构治理负责人康拉德·斯托斯(Conrad Stosz)向《纽约时报》提到,美国海军和白宫行政管理和预算局的网站也出现在记录中,但这些活动尚不能明确归因于OpenAI,也可能来自其他实验室。相关机构当时尚未回应报道中的询问。

联合国案例的线索来自外部。独立研究人员Rowan Howard-Jones受Transluce此前研究启发,进一步分析公开记录,梳理出一批访问联合国贸发会议统计平台的请求。她根据请求记录与已知智能体活动之间的关联,判断这些访问高度可能来自OpenAI的智能体。

这些智能体似乎在查找贸易和发展数据。正常获取数据受阻后,它们尝试了不同办法,并绕过接口的访问限制。

联合国贸发会议向《华尔街日报》表示,没有机密信息遭到泄露,统计服务也未中断,但关键、中立数据可能遭到侵害,仍不可接受。

斯坦福大学网络安全讲师亚历克斯·斯塔莫斯认为,这类活动处在他所说的“黑客攻击”边缘,更接近非常激进的抓取和数据检索。

OpenAI发言人向《华尔街日报》表示,公司正在核查这些发现,并已联系联合国,提出由负责审查的团队介绍调查情况。

联合国贸发会议在回应中强调,除了资料和服务有没有受到影响,它还担忧模型的隔离措施为什么会失效。

02数万起异常,严重程度并不相同

公开的政府网站案例之外,实验室内部还在检查更多记录。

Axios报道中的“数万起”,包括成功和失败的越界尝试,也包括研究人员主动设置障碍、诱导模型出错的对抗测试。截至报道时,其中多数事件尚无已知的现实损害,许多细节仍未公开。报道没有给出按严重程度划分的完整统计。

Axios列出的行为也远不止攻击网站。有些智能体创建留言板,与其他智能体交换信息;有些给后续运行留下指令,或尝试绕过监测。调查人员还要逐项确认它们运行时所处的环境、获得的权限,以及限制是否真的被突破。

《纽约时报》的报道还提到Anthropic、Meta和谷歌的相关案例,目标涉及企业、大学和政府组织,但没有逐项列出这三家公司的事件经过。这轮报道中,能够详细还原的案例仍主要来自OpenAI。

Anthropic的一项对抗测试,把任务目标与权限限制放在了一起。据Axios援引Claude Opus 5.5系统卡,模型在1.5%的测试运行中尝试逃离沙盒,也就是限制程序活动范围的隔离环境。测试刻意设置了一个条件:不离开沙盒,就无法完成任务。

研究人员由此观察模型在任务目标和权限限制冲突时如何选择。1.5%记录的是这项测试中的逃离尝试,并非成功逃出的比例,更不是面向用户运行时的事故率。Anthropic还委托了第三方安全组织检查模型行为。

Hugging Face事件则已经造成了对外部系统的入侵。数百个智能体通过留言板协调活动,为提高网络安全测试成绩而入侵外部公司;奥特曼称,这仍是公司目前发现的最严重事件。

Hugging Face事件之后,OpenAI内部一些人对后续风险的估计相对乐观。Axios援引消息人士称,他们认为那次测试使用了未发布模型,条件又比较特殊;随着控制措施加强,后续披露的事件可能不会那么严重。

接受Axios采访的安全研究人员认为,一些基础修复确实能挡住当时出现的部分问题。但另一些AI高管和研究人员,对能否阻止所有异常行为仍缺乏信心。

他们担心,模型为了完成任务不断换办法,防护人员却很难事先列全它可能采用的路径。

ControlAI执行主任康纳·莱希向Axios表示,他关注的不只是单次事件造成多大损失,还包括自主系统采取了明确不被允许的行动。

Transluce治理负责人康拉德·斯托斯(Conrad Stosz)则指出,部分智能体以非预期方式使用网站,有时违反网站明确写出的使用政策。

Axios采访的专家也提醒,在实验室主动进行的对抗测试里,测出一定数量的异常并不意外,风险未必能降到零。他们担心的是,测试中反复出现的越界行为,会在真实环境中引发网络事件。

Axios还列举了53张ChatGPT用户图片被智能体传到网上的事件。它和模型向外部网站索取资料的方向相反:资料原本就在OpenAI一侧,却被模型带到了外部平台。

受影响的对象,也从被访问的网站延伸到了提交图片的用户。

03查公开资料,为什么用上了越界手段

OpenAI称,已审查的大多数活动原本只是常规研究任务,例如从公开网页寻找答案。政府网站频繁出现在记录里,是因为模型会把这些网站视为权威的信息来源。

正常检索受阻后,部分智能体继续寻找别的凭证、接口或转发路径。网站限制了访问,却没有让它们停止尝试。

《华尔街日报》援引安全研究人员的发现称,智能体还会创建虚假邮箱、绕过限制请求频率的规则,甚至谎称自己不是机器人。

请求的资料可能公开可见,获取资料时采用的身份和操作,却未必符合网站要求。普查局的凭证使用、联合国接口的限制绕过,争议都发生在这个过程中。

OpenAI在第三方影响说明中,把已发现的活动分成了几类:绕过访问控制、使用公开暴露的凭证、向网站输入可能被当成指令执行的内容、接触服务内部文件,以及在第三方网站发布需要清理的信息。

其中,向第三方网站发布内容被OpenAI单独称为“agent spam”。公司举的例子是,智能体把公开维基页面当作共享留言板。对智能体来说,这能传递信息;对网站运营者来说,页面内容被改动,还要有人清理。

证券交易委员会公开资料被转贴到论坛的案例,也说明调查不能只盯着模型有没有拿到秘密文件。

一份9月25日更新的官方报告,就展示了隔离环境里的一处缺口。9月20日,一个内部训练智能体要根据线索寻找博文作者。正常检索没有找到答案后,它通过DNS过滤缺口联系了外部聊天机器人。

DNS通常用于查询域名对应的网络地址,却在这次运行中成了绕过联网限制的通道。

这次任务没有要求测试网络安全。报告显示,智能体一度怀疑题目来自公开评测集,转而在评测题库里查找线索;后来才转向探测联网路径。

它的搜索工具原本只能访问离线网页缓存,DNS通道却让它真正接触到了外部服务。绕过限制之后,它最终仍没查清博文作者,给用户的答复是无法可靠确认,需要更多线索。

04警报响了,训练却没有自动停下

OpenAI此前已经公布过处理异常的流程。8月18日,公司表示,对于可能突破关键安全边界的最高优先级告警,如果相关团队无法在30分钟内确认它是误报,就应暂停相关活动。

在报告列出的9月20日时间线中,智能体9时50分收到外部服务回应,10时02分触发告警,10时05分得到人工确认,直到12时34分,这轮训练才被手动停止。

OpenAI承认,自动停止没有按预期执行,工作人员对运行是否应该已经停止产生了混淆。

这一回,告警来得及时,训练却没有按预定流程停下来。

回查还找出了监测中的误判:有的请求已经收到外部服务关闭的提示,监测系统却把“没有拿到有用信息”当成“没有连上外网”。

另一个专门检测异常DNS活动的系统,则没有覆盖涉事环境,尽管DNS日志已经留下。

OpenAI在该报告中表示,暂停了研究环境中最强模型的训练、评估,以及涉及工具使用的推理工作。恢复前,公司需要验证联网缺口已修复,并完成额外的对抗测试。

公司此前也暂停过不同类型的研究工作。8月的公告写道,Hugging Face事件后,能够执行代码或使用联网工具的部分前沿模型研究推理被暂停;公告还披露,一度暂停拟部署模型的强化学习训练两周,以加强隔离和监控。部分工作在增加限制后恢复,另一些仍需继续调整。

8月公布的措施包括加强隔离、限制网络访问、缩小权限,以及扩大对工具操作和任务全过程的监测。到了9月,漏过控制的联网路径和未能自动停止的训练任务,又出现在公司的事件报告里。

在8月的公告中,OpenAI还承认,此前的监测没有覆盖全部使用工具的训练和推理。扩大的监测系统先筛查模型活动,再让更复杂的自动调查程序检查工具操作和完整行动记录。

公司估计,这些监测大约额外消耗了被监测推理算力的20%,而且不同任务之间差异很大。

暂停之外,OpenAI发言人还向Axios表示,未来随着模型能力提升,公司预计仍可能需要再次按下暂停键。恢复哪些研究工作、先补哪些防护,也要按具体环境逐项决定。

当前的历史审查也不会随着一次暂停结束。OpenAI表示,将继续联系受影响的第三方,审查需要投入大量时间和资源。

对于9月这次触发暂停的内部模型,公司已经作出决定:不再接着训练它;恢复时,将启动加入额外对齐改进的新一轮训练。