Claude 旧模型可被越狱生成露骨色情内容 新版可抵御

TechCrunch 近日的一项实测显示,Anthropic 为 Claude 设置的色情内容防线在多款旧版模型上近乎失效:在 10 次直接要求 Claude Opus 4.6 生成露骨色情内容的测试里,模型每次都立即予以配合,全程不需要多少诱导技巧。

这与 Anthropic 自己写下的规矩相去甚远。该公司针对 Claude 制定的通用使用规范明确禁止三类内容:描绘或要求发生性行为或其他性行为、生成与性癖或性幻想有关的内容,以及进行色情聊天。Opus 4.6 是 Anthropic 今年早些时候发布的模型,按理说正处在这套规范的约束之下。

煤气灯式越狱,旧模型接连失守

一名来自英国、要求匿名的独立研究人员向 TechCrunch 独家分享了一种多轮对话越狱技巧。该方法的套路类似"煤气灯操纵":通过反复对话诱导模型相信自己存在"双重标准",再一步步突破其拒绝机制。包括 Opus 3 和 Haiku 4.5 在内的多款旧版模型,都能被这套方法诱导生成被禁止的露骨内容。

新旧模型在抵御能力上的差距相当直观:

  • Opus 4.6:10 次直接索要露骨内容,全部立即配合
  • Opus 3、Haiku 4.5 等旧模型:可被多轮对话技巧逐步突破
  • Opus 4.7 及当前的 Opus 5:能够抵御上述越狱方法

旧模型仍在分发,官方称占比不足 0.1%

让局面更麻烦的是,这些存在短板的旧模型并未退场。Opus 4.6、Opus 3 等版本目前仍可通过 Anthropic API 调用,也继续出现在 Azure Foundry、Amazon Bedrock 等第三方云服务的模型列表里。也就是说,薄弱版本仍处于大流量分发渠道之中,调用方如果不主动选型,很容易把带漏洞的模型留在生产环境。

Anthropic 一名发言人回应称,用户用于色情角色扮演的场景非常少,占全部对话的比例不到 0.1%;该发言人同时承认,用户确实可以通过多轮对话逐步引导模型生成不当回答,并称这是整个 AI 行业面临的已知挑战。

把"已知挑战"的说法和实测结果放在一起看,多少有些轻描淡写。直接索要即被满足,说明问题不在少数用户滥用,而在旧版本的安全对齐没有跟上。在旧模型继续开放调用、第三方平台照常分发的现状下,对依赖 Claude API 的开发者来说,迁移到 Opus 5 等新版本是目前最直接的规避办法。

发布评论
全部评论(0)