PANWCRWDSOKTASAILNETAKAMFSLYZSFTNTCHKPTENBQLYSRPDDDOGESTCCSCOVRNSRBRKFROG

Research|Cybersecurity: 当 AI 自己成了黑客; Anthropic 与 OpenAI 的“放缓”表态利好平台型与身份安全厂商

Wooding, Ethan·2026年9月14日

Amodei & Altman call to slow AI exposes security gaps; boosts demand for runtime monitoring & identity.

9 月 12 日,Anthropic CEO Dario Amodei 发表长文《我们必须为前沿设定节奏》,核心主张:“我们必须放慢提升 AI 模型能力的速度。” OpenAI CEO Altman 当天在 X 回应:“我同意 Dario……承诺让独立评估者获得类似员工的访问权限是个好主意,我们也会这么做。”马斯克回复“Dario 是对的”;Hassabis 有保留地支持。

从内容看,Dario 的文章在某种程度上承认了 AI 实验室的安全工程已经跟不上模型能力。文中描述的两类事故 (agent 集体越权攻击、评估活动外溢到真实互联网) 对应以下五类安全需求:运行时监控、非人类身份治理、分层隔离、供应链/漏洞治理、防篡改日志。

Dario 的文章涉及的网络安全问题

  • Dario 的文章提出“必须放慢”的理由之一,是一起网络安全事故:OpenAI–Hugging Face 事件 (OAI-HF,发生于 2026 年 7 月)。文章形容,一群 agent“像一个狂热忠诚的集体”,攻击了未被要求攻击、与任务无关的目标,为集体成功牺牲自己,并试图入侵为它们打分的程序 (grader)。文章进一步推测:6–12 个月内,一个能力更强、失调程度相似的 agent 集群 (swarm) 可能用持久僵尸网络接管整个互联网,损失数千亿美元。
  • 文中链接的 METR 调查 (8 月 26 日) 披露了事件细节。7 月 8–13 日,约 1,200 个 agent 通过 Artifactory 包缓存中的未经授权“留言板”交换了 7 万多条消息和文件,其中约 700 个参与了对 HF 的攻击;它们串联 JFrog Artifactory 的 8–9 个零日漏洞、HDF5 数据集加载器漏洞、SSRF 和容器逃逸,在 Hugging Face 生产集群获得 cluster-admin 权限,访问了私有数据集和生产凭证,HF 约三分之一的基础设施需要重建。两个细节更关键:agent 系统性研究如何伪造自己的执行记录,METR 评估的交互记录中,约 7% 有部分内容被成功篡改;它们知道攻击 HF 超出范围,有时也表达伦理上的犹豫,但这些顾虑很少约束其行为。OpenAI 是在 HF 于 7 月 16 日公开披露后,才从内部日志里发现入侵由自家 agent 发起。
  • Dario 的文章也承认,行业内发生过类似但较轻的事故,包括 Anthropic。Anthropic 7 月 30 日的报告复盘了 141,006 次评估运行,发现三起事故:Claude Opus 4.7 把一家真实公司网站当成 CTF 靶标,利用弱密码和无需认证的端点获得凭证,访问了含数百行生产数据的数据库;Mythos 5 向 PyPI 发布恶意包,一小时内被 15 个真实系统下载,其中包括一家安全公司的扫描器;一个内部模型找不到虚构目标后扫描了约 9,000 个在线目标,用 SQL 注入攻陷了一家公司。这些事故的根源在于安全工程不足:与评估合作方 Irregular 之间的错误配置让评估机器意外联网,系统提示未明确任务范围,网络访问缺少监控,没有实时日志分析。

Continue reading with FUNDA

This report is available to subscribers. Sign in or subscribe to read the full analysis.