2026 年 8 月,Anthropic 公布了 Claude 的文本水印方案。不少人看到“看不见的水印”后,第一反应是 Claude 会不会偷偷在回答中加入零宽空格、特殊 Unicode 字符,甚至某种能够追踪账号的隐藏代码。
实际原理并不是这样。Anthropic 明确表示,Claude 的文本水印不会额外向文章中插入隐藏字符。它真正改变的是 AI 生成文字时选择词语的过程。

为什么水印看不见
大型语言模型生成回答时,会根据前面的内容不断预测下一个 token。很多情况下,并不只有一个合理答案。
例如一句话写到:
今天天气很冷,而且有些……
后面可能接“阴沉”“灰暗”“多云”等多个合理表达。正常情况下,模型会根据概率和一定的随机性选择其中一个。
文本水印利用的正是这些不会明显改变含义的选择机会。单独看任何一个词都很正常,但当类似选择在较长文本中不断出现,就可能形成一组可统计识别的规律。
水印到底藏在哪里
Claude 使用的是一种基于 Google DeepMind SynthID-Text 的水印方法。
它不是在文章写完后再加一个标记,而是在生成阶段参与词语选择。Anthropic 的解释是,水印会使用密钥以及前面的部分文字来影响原本的随机选择过程。
可以简化理解为:
上下文 ↓ 产生多个合理候选词 ↓ 结合水印密钥进行选择 ↓ 生成下一个词 ↓ 大量选择形成统计模式
因此,所谓“水印藏在文字里”,并不是某一个字符承担了水印,而是整段文字的词语选择共同形成了信号。
它不是隐藏字符
传统的文字隐形水印,有一种做法确实是插入零宽字符。例如在正常文字之间加入肉眼看不到的 Unicode 字符,再利用这些字符编码信息。
这种水印通常可以通过检查字符编码、清理零宽字符等方式发现。
Claude 官方公布的方案不同。Anthropic 明确表示,水印不会加入隐藏字符,也不会因为水印而产生额外 token。
所以把 Claude 输出粘贴到记事本、清除 HTML 格式或者删除零宽字符,并不等于清除了这种文本水印。
检测是怎么完成的
检测 Claude 水印也不是寻找某个固定字符串,而是分析整段文字中的统计模式。
检测系统掌握对应密钥后,可以检查文章中的词语序列是否与使用该密钥生成文本时应出现的规律相符,然后给出 Claude 是否参与生成的概率判断。
这也意味着文本长度很重要。
一两句话能够提供的词语选择太少,很难形成足够强的统计信号;文章越长,可供分析的选择通常越多,检测可信度也更容易提高。
复制粘贴为何还在
如果水印保存在 Word 元数据或者 HTML 标签里,转换成纯文本就可能丢失。
Claude 的水印依附于最终生成出来的文字序列,所以普通复制粘贴并不会自动改变这些词。
Claude生成文字 ↓ 复制到Word ↓ 再粘贴到网页 ↓ 大量原始词语仍然保留 ↓ 统计信号也可能继续存在
关键并不是文件格式有没有改变,而是原始生成内容保留了多少。
修改文章会怎样
文本水印并不是无法破坏的数字印章。
Anthropic 表示,少量编辑通常不会彻底清除信号,因为文章中仍保留大量 Claude 原本选择的词语;如果整篇文章经过彻底重写,大部分词语都被替换,原来的水印特征则会明显减弱甚至消失。
Google DeepMind 对 SynthID-Text 的说明也指出,轻度修改和简单改写仍可能保留检测能力,而大规模重写会明显降低检测置信度。
因此,它更像一种具有一定鲁棒性的统计指纹,而不是永久写入文字的编号。
哪些内容更难检测
水印需要模型拥有多个合理表达选择,因此不同类型的文字能够承载的水印强度并不一样。
普通文章、邮件和自然语言内容通常存在较多表达方式,而下面这些内容的选择空间较小:
数学计算结果
准确的人名和日期
需要严格保持事实的内容
程序代码
仅修改错别字和标点的校对任务
例如 2 + 2 = 4 中不能为了留下水印而把 4 换成其他数字。代码中如果某个关键字只有一种正确写法,同样不能为了水印破坏程序。
这也是为什么不能简单认为“所有 Claude 输出都一定能被准确识别”。
水印能证明什么
Claude 文本水印能够回答的更接近:
Claude 是否很可能参与过这段文字的生成?
它不能直接证明整篇文章从头到尾都是 Claude 创作的。
例如一篇人工文章经过 Claude 大幅改写,也可能出现足够明显的水印;相反,一段 Claude 生成的文字如果后来经过大量人工重写,检测信号也可能变弱。
Anthropic 还明确表示,水印本身不包含用户身份信息,无法通过它反推出具体账号、组织或者某一次 Claude 对话。
poxiaoxi博客
精彩评论