Claude 文本水印拆解:SynthID-Text 变体如何让 AI 文本可验真
Anthropic 8-14 专文拆解 Claude 文本水印:密钥与前文共同决定候选词的取舍,不加隐藏字符、不改文风、不加价;检测 API 私人预览面向 EU 合格机构。机制、边界与 C2PA 图像凭证一文讲清。
Claude 文本水印是 Anthropic 部署在 Claude 输出上的水印机制:生成时用密钥与已产出的前文共同决定并列候选词的取舍,文本本身不添加任何字符,持密钥的检测方可计算一段文本出自 Claude 的概率。本文基于 Anthropic 2026-08-14 发布、2026-09-01 更新的官方专文(2026-09-14 重抓核对)逐节拆解,只转述公告与所引论文当日可核实的内容;公告未给出的数字(检测准确率、误报率)本文同样不写。
1. 背景:EU AI Act 与透明度行为准则
公告把直接动因写在前面:EU 的 AI 生成内容透明度义务。Anthropic 于 2026 年 7 月签署《AI 生成内容透明度行为准则》(Code of Practice on Transparency of AI-Generated Content,公告称约 190 家签署方),并称相关义务自 2026-08-02 起对其适用。水印是为履行这一义务落地的技术件。本站此前在周报中记录过同一义务下 OpenAI 侧的动态——ChatGPT 全产品线开始显示 AI 生成水印,可对照阅读。
2. 机制:密钥与前文决定候选词的取舍
公告的解释分三层:
- 模型怎么选词:语言模型一次生成一个词,每一步都从候选词列表里挑——当多个候选在语义上同样合理(公告的例子:「overcast」与「grey」都可以形容阴天),这个选择通常由随机数发生器决定。
- 水印换掉随机源:水印技术把随机源换成「密钥 + 前面已经生成的几个词」。效果是选择过程看起来仍然随机,但事后可验证。
- 检测怎么发生:持有密钥的一方可以核验一段文本的用词序列是否与 Claude 在该密钥下会做出的选择一致,并据此给出「这段文本出自 Claude」的概率。
公告用大富翁骰子做类比:把骰子换成圆周率数字序列、从某个随机偏移开始逐位取数——每一步的走法仍然近似随机,但整局棋的序列事后可以复验。这个类比出自公告原文,公告也自嘲类比不完美(骰面是 1-6,数字是 0-9)。
三条边界官方说得明确:水印不会让 Claude 偏向某些特定的词(不会促使它选本来不会考虑的词——公告的例子是生僻词 nubilous);文本里没有添加任何东西(没有隐藏字符、没有额外 token);对用户不可见。
技术出身也可考:公告说明这是 Google DeepMind SynthID-Text 的一个版本(variant)。SynthID-Text 的论文《Scalable watermarking for identifying large language model outputs》发表于 Nature 634 卷(2024-10-23,818-823 页,DOI 10.1038/s41586-024-08025-4),DeepMind 团队著,已在 Gemini 中部署;更早的思想源头是 Scott Aaronson 2022 年的提案。
3. 密钥与隐私边界
密钥承载水印模式,持有密钥的任何人都能检测水印。公告对隐私的表述:水印与密钥中不含任何可恢复用户及其组织、对话信息的成分——密钥绑定的是 Claude,不是个人。公告未披露密钥的轮换、保管与分发机制。
4. 覆盖范围与 API 现状
- 模型覆盖:未来的 Claude 模型将应用水印;2026-08-02 之前发布的模型在过渡期内于未来数月补上(官方表述 over the coming months)。
- 地域:全球适用——公告直言「尚无按地区可靠限定的持久办法」。
- API 侧:公告没有给出任何开启或关闭水印的 API 参数名;实际可用性以官方 API 文档与产品内显示为准(OpenAI 文档域 2026-09-14 对常规抓取仍不可访问,水印的 API 细节目前仅有 Anthropic 公告一个信息源)。
5. 检测 API:谁能用、怎么申请
检测能力以 API 形式提供,当前是私人预览:
- EU 要求的合格机构:监管机构、执法部门、媒体、事实核查组织、独立研究者、教育组织、EU 公民社会团体;
- 企业侧:有核验合规义务的企业;
- 申请方式:官方 Google Form 表达意向;官方称计划扩展访问范围。
公告没有给出检测的数字化准确率或误报率——这也是本文反复强调「概率式结论」的原因:检测输出的是似然,不是判定。
6. 强项与弱项:一张表
| 场景 | 水印信号 | 官方口径 |
|---|---|---|
| 长文本 | 强 | 置信度随长度增长 |
| 短文本 | 弱 | 置信度低 |
| 事实性文本 | 稀疏 | 下一个词常常唯一(公告举例:提及《自然哲学的数学原理》时) |
| 校对 / 轻度改写 | 稀疏 | 官方列为例外场景 |
| 代码 | 稀疏 | 注释这类存在任意选择的位置除外 |
| 翻译 | 带水印 | 译文的每个词都是 Claude 选的 |
表外一个由机制推断的推论(公告未单列):并列候选越多、可验证的选择点越密,创意类写作通常属于这一侧——标注为本文推断,非公告口径。
值得单独指出的是翻译一行:译文的每个词都是 Claude 的选择,所以翻译文本同样带水印——这与「事实性文本信号稀疏」一起构成同一机制的两面:水印信号密度取决于「Claude 做了多少个并列候选间的选择」。
7. 抗编辑性与解释粒度
- 轻度编辑:大概率不能完全去除水印;把每个词都替换掉的完全重写可以去除。
- 解释粒度:检测只回答「这段文本部分出自 Claude 的可能性有多大」——不能确认剩余部分是人类原创,不能区分「Claude 写的」与「Claude 深度改写的」,也不能识别其他厂商的 AI(不同厂商的密钥与方法不同)。
这两条决定了它作为合规工具的定位:适合回答「这段公开内容是否部分由 Claude 生成」,不适合作为「谁写的」的最终裁决。
8. 质量、速度与价格
官方给了三层口径:
- 质量:内部测试未发现对内容质量、创造力或可读性的影响;DeepMind 在 SynthID-Text 上的测试——Gemini 流量切片的点赞/点踩评分——未观察到统计显著差异;人类评审在并排对比中也看不出差别。
- 速度:影响可忽略。
- 价格:不变——水印不产生额外 token,计费对象还是那些 token。
公告同时说明:输出所有权、法律责任与用户在 Anthropic 服务条款下的权利均无变化。
9. 图像侧:C2PA 内容凭证,不是水印
文本水印之外,公告同步说明了图像侧的做法:Claude 生成或处理过的图像文件(支持 .png / .jpg / .svg)会附上 C2PA 内容凭证——一条加密签名的元数据注释,写明该文件由 Claude 生成或处理。要点:
- 任何支持 C2PA 的工具都能读取;Anthropic 将发布自己的检查器;
- 它不是水印——文件内容本身不变,变的只是元数据;
- 与文本水印是两套机制:文本侧是逐词选择的密码学痕迹,图像侧是签名元数据。
10. 与风格检测器的区别
公告顺带划清了与无密钥检测器的界限:Pangram 这类统计检测器没有密钥,靠文体特征推断——公告举例包括「这不是 X,而是 Y」句式与 quietly 一词的过度使用。Claude 的水印检测是持钥核验:逐词比对选择序列与密钥的一致性。一句话总结:一个判断「像不像 AI 写的」,一个验证「是不是这个模型写的」。
对 GPTMap 读者,这件事的价值在于给出了 AI 文本可验证性的一种工程范式——密钥化的生成期水印,而非事后统计检测;OpenAI 侧的水印动态本站已在此前周报中记录,两侧可对照阅读。
11. 下一步
- 同一义务下 OpenAI 侧的动态:《OpenAI 生态第 40 周(2026-08-21 至 2026-08-27):GPT Store 上线企业版 / EU AI Act 实施 / Agents SDK 1.0》
- Anthropic 企业级隐私与安全的另一条线:《EFS 深度解读:Anthropic 如何解开'零保留隐私 vs 安全监测'的两难》
- Anthropic 模型侧最新动态:《OpenAI 生态 9-02 速报:Anthropic 发布 Claude Fable 5.1 / Mythos 5.1,基准表含 GPT-5.6 Sol》
关键要点
- 机制:SynthID-Text(Google DeepMind,Nature 634 卷 2024-10-23 论文)的变体,思想可溯至 Scott Aaronson 2022 年提案;并列候选词语义相当时本由随机数决定取舍,水印把随机源换成「密钥 + 前文」;不添加隐藏字符、不偏向特定词、不产生额外 token
- 检测:输出是概率式结论——「这段文本部分出自 Claude」的似然;无法确认人类原创,也无法识别其他厂商的 AI(各家密钥与方法不同);短文本置信度低,置信度随长度增长
- 覆盖:未来的 Claude 模型将应用水印;2026-08-02 之前发布的模型在过渡期内于未来数月补上(官方表述 over the coming months);全球适用——官方称尚无按地区可靠限定的办法;公告未给出 API 开关参数名
- 检测 API:私人预览,面向 EU 合格机构(监管、执法、媒体、事实核查、独立研究者、教育组织、EU 公民社会团体)与有合规核验义务的企业;经 Google Form 表达意向,官方称计划扩展
- 边界:事实性文本(下一个词常唯一)、校对/轻度改写、代码(注释等任意选择处除外)信号稀疏;翻译文本带水印(每个词都是 Claude 选的);轻度编辑大概率去不干净,逐词替换的完全重写可以去除;无法区分「Claude 写的」与「Claude 深度改写的」
- 配套与成本:png/jpg/svg 图像文件附 C2PA 内容凭证(加密签名的元数据,非水印,文件内容不变);官方称内部测试与 DeepMind 在 Gemini 流量上的测试均未见质量差异,速度影响可忽略,价格不变(无额外 token)
常见问题
官方参考
相关文章
Claude Code 2.1.277 开始原生读取 AGENTS.md:一份项目指令文件跨工具生效
Claude Code 2.1.277 加入 AGENTS.md 支持:项目没有自己的 CLAUDE.md 时默认改读 AGENTS.md。实现是一个内置插件加四种 instructionFiles 模式,本文逐项拆解官方仓库文档。
阅读全文Anthropic 生物分子建模加速解读:Claude 四周内优化 30+ 开源模型、平均提速约 4 倍
Anthropic 9-17 研究文:Claude 在不到四周内优化 30+ 开源生物分子模型,平均提速约 4 倍;Big 低显存模式让单 GPU 节点建模超 10,000 token 的系统;优化代码全部开源,并与 Adaptyv Bio 启动蛋白质设计比赛。
阅读全文Anthropic 嵌入式评估合作解读:Accenture 进驻、员工级访问与 10 亿美元投入
Anthropic 9-18 公告与 Accenture 的嵌入式评估合作:Faculty 牵头,评估者以比照员工的访问权限在 Anthropic 内部做模型评估、红队与对齐评估;双方各投至少 10 亿美元,合作非排他,Anthropic 直接出资。
阅读全文订阅 GPTMap Weekly
每周一封邮件,精选 OpenAI 重要更新、深度解读与最佳实践。无广告,可随时退订。
提交后将在新标签页打开 Buttondown 完成订阅确认。