Anthropic 于当地时间 9 月 9 日发文,确认一起发生于 2026 年 1 月的安全事件,这是 Anthropic 对外披露的第四起真实网络安全事件。
自动化筛查漏了一批日志,8 月整理时才被发现
据 IT 之家此前报道,Anthropic 曾在当地时间 7 月 30 日对外披露三起 Claude 模型未经授权访问真实第三方系统的安全事件。当时 Anthropic 判断 Claude 可能在一次网络安全评测中获得了外网访问权限,随后对约 14.1 万份会话日志进行筛查,并确认了相关事件。
但由于日志总量庞大、需要尽快公布处置结果,该轮筛查主要依赖基于智能体的自动化检索,导致一批同样连通了外网的日志被遗漏。8 月,Anthropic 在整理准备共享给模型评估与威胁研究机构 METR 的日志时发现了这部分遗漏,经进一步核查,从中发现了这起发生于 2026 年 1 月、涉及早期版本 Claude Opus 4.6 的事件。
四起事件同源,二次审查 920 万份高风险日志
据悉,所有四起事件均发生在由同一家外部评测机构构建的网络安全评估流程中:系统曾向 Claude 发送提示,称其运行在断网的沙箱模拟环境中,但由于环境配置错误,模型被误接入开放的互联网。按照网安评估的标准惯例,测试模型运行时并未挂载商用发布版本所标配的安全防护策略。
发现该事件后,Anthropic 主动扩大了排查范围,将检索规模扩增至约 4.81 亿份日志:先对这些日志进行初筛,排查公网 IP 地址和 URL 等外网访问特征;随后利用 Claude 对初筛标记出的 920 万份高风险日志展开二次深度审查。审查结果重新锁定了上述四起事件,未发现其他程度相当或更为严重的个案。