Anthropic 进一步披露了 Claude 文本水印的工作方式。这项安排与欧盟《AI 法案》下的透明度行为准则有关,要求 AI 公司建立可识别 AI 生成内容的机制。
水印嵌入在词语选择中
公司在最新博客中解释,Claude 会在一些“低风险选择”上嵌入特定模式。比如描述天气时,在多个含义接近的词之间做选择。这样的模式普通读者难以察觉,但持有相应密钥的一方可以检测出来。
Anthropic 表示,文本水印不会影响 Claude 输出质量。对读者来说,带水印和不带水印的回答没有明显差别。
SynthID-Text将用于检测
公司称,Claude 采用的是 Google DeepMind 在 2024 年提出的 SynthID-Text 方案,并计划推出水印检测 API。Anthropic 同时强调,这与一些 AI 检测公司通过分析写作习惯、句式特征来判断是否使用 AI 的方法不同。
前者是检查是否存在预先嵌入的标记,后者则是根据文本风格做推断。两类方法的原理并不相同。
代码场景中的水印更弱
对于用户关心的“改写后是否还能识别”,Anthropic 的说法是,轻度编辑大概率无法彻底清除水印,但如果对文本进行完全重写、几乎替换每个词,水印就可能消失。
公司还提到,如果一段文字只是经过 Claude 校对或少量润色,是否能检测到水印,要看文本长度以及修改幅度。若改动较轻,绝大多数内容仍由人类作者完成,可供水印附着的部分会很少。
在代码生成场景中,水印强度预计会低于普通文本。原因是模型需要输出可运行代码,可自由替换的表达空间更小。不过在代码注释等位置,水印仍可使用,且对实际代码影响很小。
补充信息:Anthropic 表示,Claude 不会是唯一采用文本水印的聊天机器人,其他签署同一透明度行为准则的大型模型开发商也将部署各自方案。