GPTMap

Claude 文本水印拆解:SynthID-Text 变体如何让 AI 文本可验真

Anthropic 8-14 专文拆解 Claude 文本水印:密钥与前文共同决定候选词的取舍,不加隐藏字符、不改文风、不加价;检测 API 私人预览面向 EU 合格机构。机制、边界与 C2PA 图像凭证一文讲清。

TL;DR
Anthropic 于 2026-08-14 发文说明 Claude 文本水印(09-01 更新检测 API 信息):技术上是 Google DeepMind SynthID-Text(Nature 2024 论文)的变体——生成时用密钥与已产出的前文共同决定并列候选词的取舍,不添加隐藏字符、不偏向特定词;持密钥可计算一段文本出自 Claude 的概率。未来模型将应用水印,2026-08-02 之前发布的模型在过渡期内于未来数月补上,全球适用。检测 API 处于私人预览,面向 EU 合格机构与有核验义务的企业;png/jpg/svg 图像附 C2PA 内容凭证。官方称不影响质量、速度影响可忽略、价格不变。
Claude 文本水印是 Anthropic 部署在 Claude 输出上的文本水印机制(Google DeepMind SynthID-Text 的变体):模型在每个生成步骤从多个语义相当的候选词中做选择时,用密钥与已生成的前文共同决定取哪一个;文本本身不添加任何字符,持密钥的检测方可计算该文本出自 Claude 的概率。

Claude 文本水印是 Anthropic 部署在 Claude 输出上的水印机制:生成时用密钥与已产出的前文共同决定并列候选词的取舍,文本本身不添加任何字符,持密钥的检测方可计算一段文本出自 Claude 的概率。本文基于 Anthropic 2026-08-14 发布、2026-09-01 更新的官方专文(2026-09-14 重抓核对)逐节拆解,只转述公告与所引论文当日可核实的内容;公告未给出的数字(检测准确率、误报率)本文同样不写。

1. 背景:EU AI Act 与透明度行为准则

公告把直接动因写在前面:EU 的 AI 生成内容透明度义务。Anthropic 于 2026 年 7 月签署《AI 生成内容透明度行为准则》(Code of Practice on Transparency of AI-Generated Content,公告称约 190 家签署方),并称相关义务自 2026-08-02 起对其适用。水印是为履行这一义务落地的技术件。本站此前在周报中记录过同一义务下 OpenAI 侧的动态——ChatGPT 全产品线开始显示 AI 生成水印,可对照阅读。

2. 机制:密钥与前文决定候选词的取舍

公告的解释分三层:

  1. 模型怎么选词:语言模型一次生成一个词,每一步都从候选词列表里挑——当多个候选在语义上同样合理(公告的例子:「overcast」与「grey」都可以形容阴天),这个选择通常由随机数发生器决定。
  2. 水印换掉随机源:水印技术把随机源换成「密钥 + 前面已经生成的几个词」。效果是选择过程看起来仍然随机,但事后可验证。
  3. 检测怎么发生:持有密钥的一方可以核验一段文本的用词序列是否与 Claude 在该密钥下会做出的选择一致,并据此给出「这段文本出自 Claude」的概率。

公告用大富翁骰子做类比:把骰子换成圆周率数字序列、从某个随机偏移开始逐位取数——每一步的走法仍然近似随机,但整局棋的序列事后可以复验。这个类比出自公告原文,公告也自嘲类比不完美(骰面是 1-6,数字是 0-9)。

三条边界官方说得明确:水印不会让 Claude 偏向某些特定的词(不会促使它选本来不会考虑的词——公告的例子是生僻词 nubilous);文本里没有添加任何东西(没有隐藏字符、没有额外 token);对用户不可见。

技术出身也可考:公告说明这是 Google DeepMind SynthID-Text 的一个版本(variant)。SynthID-Text 的论文《Scalable watermarking for identifying large language model outputs》发表于 Nature 634 卷(2024-10-23,818-823 页,DOI 10.1038/s41586-024-08025-4),DeepMind 团队著,已在 Gemini 中部署;更早的思想源头是 Scott Aaronson 2022 年的提案。

3. 密钥与隐私边界

密钥承载水印模式,持有密钥的任何人都能检测水印。公告对隐私的表述:水印与密钥中不含任何可恢复用户及其组织、对话信息的成分——密钥绑定的是 Claude,不是个人。公告未披露密钥的轮换、保管与分发机制。

4. 覆盖范围与 API 现状

  • 模型覆盖:未来的 Claude 模型将应用水印;2026-08-02 之前发布的模型在过渡期内于未来数月补上(官方表述 over the coming months)。
  • 地域:全球适用——公告直言「尚无按地区可靠限定的持久办法」。
  • API 侧:公告没有给出任何开启或关闭水印的 API 参数名;实际可用性以官方 API 文档与产品内显示为准(OpenAI 文档域 2026-09-14 对常规抓取仍不可访问,水印的 API 细节目前仅有 Anthropic 公告一个信息源)。

5. 检测 API:谁能用、怎么申请

检测能力以 API 形式提供,当前是私人预览:

  • EU 要求的合格机构:监管机构、执法部门、媒体、事实核查组织、独立研究者、教育组织、EU 公民社会团体;
  • 企业侧:有核验合规义务的企业;
  • 申请方式:官方 Google Form 表达意向;官方称计划扩展访问范围。

公告没有给出检测的数字化准确率或误报率——这也是本文反复强调「概率式结论」的原因:检测输出的是似然,不是判定。

6. 强项与弱项:一张表

场景水印信号官方口径
长文本强置信度随长度增长
短文本弱置信度低
事实性文本稀疏下一个词常常唯一(公告举例:提及《自然哲学的数学原理》时)
校对 / 轻度改写稀疏官方列为例外场景
代码稀疏注释这类存在任意选择的位置除外
翻译带水印译文的每个词都是 Claude 选的

表外一个由机制推断的推论(公告未单列):并列候选越多、可验证的选择点越密,创意类写作通常属于这一侧——标注为本文推断,非公告口径。

值得单独指出的是翻译一行:译文的每个词都是 Claude 的选择,所以翻译文本同样带水印——这与「事实性文本信号稀疏」一起构成同一机制的两面:水印信号密度取决于「Claude 做了多少个并列候选间的选择」。

7. 抗编辑性与解释粒度

  • 轻度编辑:大概率不能完全去除水印;把每个词都替换掉的完全重写可以去除。
  • 解释粒度:检测只回答「这段文本部分出自 Claude 的可能性有多大」——不能确认剩余部分是人类原创,不能区分「Claude 写的」与「Claude 深度改写的」,也不能识别其他厂商的 AI(不同厂商的密钥与方法不同)。

这两条决定了它作为合规工具的定位:适合回答「这段公开内容是否部分由 Claude 生成」,不适合作为「谁写的」的最终裁决。

8. 质量、速度与价格

官方给了三层口径:

  • 质量:内部测试未发现对内容质量、创造力或可读性的影响;DeepMind 在 SynthID-Text 上的测试——Gemini 流量切片的点赞/点踩评分——未观察到统计显著差异;人类评审在并排对比中也看不出差别。
  • 速度:影响可忽略。
  • 价格:不变——水印不产生额外 token,计费对象还是那些 token。

公告同时说明:输出所有权、法律责任与用户在 Anthropic 服务条款下的权利均无变化。

9. 图像侧:C2PA 内容凭证,不是水印

文本水印之外,公告同步说明了图像侧的做法:Claude 生成或处理过的图像文件(支持 .png / .jpg / .svg)会附上 C2PA 内容凭证——一条加密签名的元数据注释,写明该文件由 Claude 生成或处理。要点:

  • 任何支持 C2PA 的工具都能读取;Anthropic 将发布自己的检查器;
  • 它不是水印——文件内容本身不变,变的只是元数据;
  • 与文本水印是两套机制:文本侧是逐词选择的密码学痕迹,图像侧是签名元数据。

10. 与风格检测器的区别

公告顺带划清了与无密钥检测器的界限:Pangram 这类统计检测器没有密钥,靠文体特征推断——公告举例包括「这不是 X,而是 Y」句式与 quietly 一词的过度使用。Claude 的水印检测是持钥核验:逐词比对选择序列与密钥的一致性。一句话总结:一个判断「像不像 AI 写的」,一个验证「是不是这个模型写的」。

对 GPTMap 读者,这件事的价值在于给出了 AI 文本可验证性的一种工程范式——密钥化的生成期水印,而非事后统计检测;OpenAI 侧的水印动态本站已在此前周报中记录,两侧可对照阅读。

11. 下一步

关键要点

  • 机制:SynthID-Text(Google DeepMind,Nature 634 卷 2024-10-23 论文)的变体,思想可溯至 Scott Aaronson 2022 年提案;并列候选词语义相当时本由随机数决定取舍,水印把随机源换成「密钥 + 前文」;不添加隐藏字符、不偏向特定词、不产生额外 token
  • 检测:输出是概率式结论——「这段文本部分出自 Claude」的似然;无法确认人类原创,也无法识别其他厂商的 AI(各家密钥与方法不同);短文本置信度低,置信度随长度增长
  • 覆盖:未来的 Claude 模型将应用水印;2026-08-02 之前发布的模型在过渡期内于未来数月补上(官方表述 over the coming months);全球适用——官方称尚无按地区可靠限定的办法;公告未给出 API 开关参数名
  • 检测 API:私人预览,面向 EU 合格机构(监管、执法、媒体、事实核查、独立研究者、教育组织、EU 公民社会团体)与有合规核验义务的企业;经 Google Form 表达意向,官方称计划扩展
  • 边界:事实性文本(下一个词常唯一)、校对/轻度改写、代码(注释等任意选择处除外)信号稀疏;翻译文本带水印(每个词都是 Claude 选的);轻度编辑大概率去不干净,逐词替换的完全重写可以去除;无法区分「Claude 写的」与「Claude 深度改写的」
  • 配套与成本:png/jpg/svg 图像文件附 C2PA 内容凭证(加密签名的元数据,非水印,文件内容不变);官方称内部测试与 DeepMind 在 Gemini 流量上的测试均未见质量差异,速度影响可忽略,价格不变(无额外 token)

常见问题

按 Anthropic 2026-08-14 公告的表述:语言模型逐词生成,每一步从候选词列表里挑一个——当多个候选在语义上同样合理(公告的例子:overcast 与 grey),这个选择通常由随机数发生器决定。水印做的事是把随机源换掉:用密钥和前面已经生成的几个词来决定取舍。文本本身什么都没有添加——没有隐藏字符、没有额外 token,也不改变模型对词的偏好。

官方参考

相关文章

订阅 GPTMap Weekly

每周一封邮件,精选 OpenAI 重要更新、深度解读与最佳实践。无广告,可随时退订。

提交后将在新标签页打开 Buttondown 完成订阅确认。

GPTMap Editorial发布于 2026-09-14 12 分钟阅读
测试环境(EEAT)
最后测试时间:2026-09-14
使用模型:gpt-5.6