Cloudflare 于 9 月 15 日宣布推出名为“Disallow AI Training”的新设置,允许网站管理员在继续向搜索引擎开放内容的同时,明确拒绝将其用于 AI 模型训练。苹果、谷歌和微软均已承诺遵守该规则。
具体来说,启用该设置后,Cloudflare 仍允许那些既用于搜索索引又用于 AI 训练的混合型爬虫抓取内容。但前提是,系统会将其标记为“Accountable”(可问责),这意味着这些爬虫背后有明确的责任主体。其他未被标记或不遵守规则的 AI 训练爬虫,则会被直接拦截。
Cloudflare 提醒,全面拦截所有 AI 训练爬虫有可能影响网站在搜索引擎中的排名。对于此前已经在“Training”选项中选择了“Block”或“Block on pages with ads”的现有客户,该设置会自动迁移至新的“Disallow AI Training”,大多数用户无需手动操作。
这一举动实质上是 Cloudflare 试图在网站流量、内容保护与 AI 行业需求之间划定更清晰的界限。与依赖网站单方面部署的 robots.txt 文件不同,Cloudflare 作为 CDN 和安全服务商,在网络边缘层执行策略,对不守规矩的爬虫具备更强的强制力。
在厂商支持方面,谷歌计划在未来几周内为 Google-Extended 爬虫推出 URL 层级的透明度工具,让站长能更精细地控制哪些页面可被用于 AI 训练。苹果也在开发类似的 URL 层级工具。微软的动作稍慢,计划在 2027 年初通过支持 robots.txt 协议来实现拒绝 AI 训练的功能。这些工具将与 Cloudflare 的设置形成互补或竞争关系,共同构建起未来网站内容授权的基础设施。



