Anthropic 于当地时间 8 月 14 日发布的最新安全报告披露,该公司用于拦截化学和生物武器相关危险请求的安全分类器曾长期失效,持续时间从 2025 年 5 月到 2026 年 4 月,近一年。期间约 5 万名外部承包商产生的约 1.33 亿次模型对话未经过相关生物安全分类器拦截。
根据 Anthropic 公开的安全机制说明,其安全系统包含实时提示词和输出分类器,用于分析用户输入和模型生成内容,识别到风险时阻止模型提供可能用于危险行为的信息。这套机制是 Anthropic 针对化学、生物、放射性及核武器(CBRN)风险设置的多层防护措施之一。
问题的根源在于外部承包商管理环节。约 5 万名承包商在失效期间产生了约 1.33 亿次与模型的对话,这些流量没有经过相关生物安全分类器的拦截。Anthropic 表示,这些承包商主要由外部供应商负责审核,其筛查流程存在不足。
Anthropic 称内部调查没有发现这些请求被实际用于滥用的证据。公司已修复问题,并提高了对外部承包商的筛查和管理要求。
时间线值得关注。2025 年 5 月 Claude Opus 4 发布时,Anthropic 启用了 AI 安全等级 3(ASL-3)防护措施,包含针对 CBRN 风险的部署限制。然而正是从这个时间点开始,分类器出现了失效,直到 2026 年 4 月才被发现并修复。这意味着 ASL-3 防护框架在启用之初就存在执行层面的漏洞,安全策略的制定和落地之间存在明显落差。
从行业角度看,这件事暴露出 AI 安全治理中一个容易被忽视的环节:承包商管理。头部 AI 公司在模型训练和红队测试中大量依赖外部承包商,这些人员可以接触到模型的大量交互数据。如果承包商的筛查流程和分类器配置脱节,安全防线就会出现盲区。
Anthropic 选择主动披露这一漏洞而非被外部发现后被动回应,这种做法本身值得肯定。但"没有发现滥用证据"并不等于风险不存在,1.33 亿次对话在近一年时间里绕过生物安全过滤器,意味着大量潜在的危险请求可能已经进入模型的上下文窗口。即便最终没有导致实际滥用事件,这个窗口期的存在本身就说明当前 AI 安全体系在工程可靠性上还有很长的路要走。



