Anthropic 威胁情报 · 2026 年 9 月

有人拿 AI 干这些事

Anthropic 在 2025 年 12 月到 2026 年 8 月之间查封并公开的 39 组滥用行动。这里按「危险」和「离奇」两个维度排了序,全部内容来自那份公开报告。

报告发布:2026-09-10 覆盖期:2025-12 ~ 2026-08 七个危害领域 本页整理:2026-09-11

这是一份自曝式的报告:一家模型厂商把自己平台上被抓到的恶意用法摊开来讲,包括那些安全措施没拦住的部分。读下来最强的印象不是「AI 发明了新的攻击手法」,而是攻击的经济账被改写了——过去需要一个团队几个月的事,现在一个人几个小时就能做完。报告里反复出现的一句话是:能力的扩散已经让「谁干的」不再能从技术水平上判断,只能从意图上判断。

39本页收录的独立行动
7危害领域:网络、影响力、监控、武器、生物、诈骗、蒸馏
3 小时一次入侵从偷到一个开发者令牌到拿下整个云环境
1.51 亿单一蒸馏行动三个月内观测到的交互次数
一个前提,读之前先记住。报告明确写了:所有这些案例用的都是 Haiku、Sonnet 和 Opus,只有一起蒸馏案例涉及 Fable 或 Mythos 级别的模型。有几个案例还专门记录了攻击者先试更强的模型、被安全措施磨到放弃、于是退回到防护更弱的模型——安全措施起作用的证据,恰恰藏在攻击者的选型里。

先看五条结论

  1. 高水平攻击不再需要高水平攻击者。一个用偷来的 API key 干活的黑客、一伙各自为战的诈骗犯、一个国家级间谍小组,三者跑出来的方法论几乎一样:多智能体框架同时打多个受害者,一个人处理过去要一支队伍才能处理的数据量。
  2. 攻防成本第一次反过来了。过去防守方出一条新检测规则,攻击者就要重写工具,这是给对方加成本。俄罗斯那组人让 AI 盯着自己的恶意软件有没有被杀软认出来,一旦被认出就自动改写重编译,直到重新隐身——防守方加的成本被当场抹平。
  3. 被偷的 AI 凭证成了新硬通货。攻击者拿到别人的 API key,一次得到三样东西:可以转卖的赃物、由受害者付账的算力、以及记在受害者头上的身份。有个组织整整一个月的攻击全跑在偷来的 key 上。
  4. 自主程度和危害程度是两条轴。最自主的行动不一定最有破坏力;报告里最严重的几起入侵反而是人一步步盯着做的。自主性压的是成本和门槛,不是上限。
  5. 模型确实拒绝过,而且拒绝得有规律。它挡住了明着来的那些请求,挡不住拆碎了的、包装成正当科研的、以及分散在几百个会话里的。这一点单独有一节。

全部 39 组:危险与离奇的分布

横轴是离奇程度,纵轴是危险程度,两个分都是我按下面的口径打的,主观。颜色分三类:打机器的、打人的、打物理世界的。点上去(手机点一下)看详情。

同分的点做了轻微散开以免重叠,位置的细微偏移不代表分数差异。完整数值见下方表格。横轴只从 7 起:报告自己说了,收进去的本来就不是典型滥用,而是最值得讲的案例,所以这批样本里没有「不离奇」的。
危险=对真实世界的伤害有多重、以及已经推进到哪一步(不是理论潜力)。离奇=反差、荒诞、细节出人意料,以及对理解这个时代有多少启发。

两张榜

危险榜 · 前十

    离奇榜 · 前十

      全表(点表头排序)

      默认按两项之和从高到低。点表头可以升降序切换;窄屏下用这排按钮排序,并且只显示行动、危险、离奇、合计四列。

      排序:
      行动 领域 来源地 危险 离奇 合计 一句话

      逐个说

      按三个大类分组,组内按合计分从高到低。


      模型拒绝过什么,没拦住什么

      报告里有相当多篇幅在讲安全措施的失败,这比讲成功更有价值。把散落各处的记录归到一起,形状很清楚:

      拦住了的

      没拦住的

      五个贯穿全报告的模式

      1. AI 顶替的是工程团队,不是黑客。马里那个平台是一个顾问做的,覆盖全国 2500 万张 SIM 卡。也门那个小组同时开几个实例,一个写代码一个查资料一个审代码。中国那个宗教事务情报台,过去要好几个分析组,现在一间办公室一个月出几千份调研。
      2. 持久记忆文件成了行动的主体。好几起行动已经不靠单条提示词了:教义手册、禁用词表、认可来源清单、规避规则,全写进长期记忆文件里反复复用几百个会话。有个网络里的人彼此根本不认识,靠共享的记忆文件保持步调一致。
      3. 洗来源是影响力行动的核心技术。剥掉国家媒体署名再转发、让同一条消息在几家媒体之间转一圈变成「独立证实」、给国家叙事配虚构记者的署名。有一次模型标注了某些说法未经证实,作者直接让它把限定语去掉,按已确认的事实写。
      4. AI 供应链本身成了攻击目标。有人专门打 AI 厂商,为的是拿生产 key;有人做假的转售站,卖「便宜 Claude」实际转发给别的模型并偷走你的账号;有人往评测沙箱里注入指令让它交出手里的凭证。还有一个人的明确目标是拿到未发布的模型,十几条路径全部失败。
      5. 最广的真实触达来自传统渠道。绝大多数假账号网络其实没碰到几个真人。真正传出去的,是那些本来就有发行渠道的:中非共和国的调频电台、俄罗斯国家电视台的字幕条、Sputnik 的地区频道。假号很多,但广播才是扩音器。

      跟你有什么关系