AI 写出来的东西,能认出来吗
这是 2024 年以来一直困扰学术界和业界的问题。
OpenAI 在 GPT-4 之后开始测试水印技术。Google 的 Perplexity 也内置了水印。Meta、Anthropic 都在跟进。
目的很明确:让 AI 生成的文本有一个可验证的"指纹"。
但水印技术真的靠谱吗?先搞清楚原理,再来判断。
水印是怎么工作的
最主流的方案叫 Embedding Watermarking,由 Kim 等人在 2023 年提出。
核心思想很简单:在生成文本时,对每个 token 的候选列表做一个伪随机分割。
具体步骤:
- 模型计算当前上下文的概率分布,得到 top-k 个候选 token
- 用密钥(密钥是水印系统的共享秘密)对这些候选 token 做哈希
- 哈希值小的标记为"绿色",大的标记为"红色"
- 生成时,优先从绿色 token 中选
这样,AI 生成的文本中,绿色 token 的比例会显著高于随机文本。
检测的时候,用同样的密钥对文本中的 token 做同样的哈希和分类,计算绿色比例。如果远高于随机期望值,就判定为 AI 生成。
举个具体例子
假设当前上下文是"今天天气真",模型输出的 top-4 候选是:
| Token | 概率 | 哈希值 | 颜色 |
|---|---|---|---|
| 好 | 0.35 | 0x3A | 绿色 |
| 不 | 0.25 | 0x8F | 红色 |
| 不错 | 0.20 | 0x12 | 绿色 |
| 冷 | 0.15 | 0xCC | 红色 |
正常采样时,模型会按概率随机选一个。
但加水印后,绿色 token 的采样概率被调高:
- 好:0.35 × 4 = 1.4
- 不错:0.20 × 4 = 0.8
- 不:0.25 × 1 = 0.25
- 冷:0.15 × 1 = 0.15
重新归一化后,绿色的概率从 55% 变成了 77%。
长期累积下来,AI 生成的文本里绿色 token 占比明显偏高。
检测器就是靠这个统计差异来判断的。
几个关键问题
密钥泄露怎么办
水印的安全性依赖于密钥保密。
如果有人知道了密钥,就可以对任何文本做水印验证,或者自己生成带水印的文本。
实际系统中,密钥通常存储在模型服务商的服务器端,不对外公开。用户生成的文本自带水印,但密钥不在用户手里。
改写能绕过吗
这是水印技术最大的弱点。
如果 AI 生成的文本经过以下处理:
- 同义词替换
- 句式调整
- 段落重组
- 人工润色
水印的统计特征会被大幅削弱。
一篇论文实测:简单的改写操作就能让水印检测的准确率从 95% 降到 50% 以下。
误报问题
水印检测不是二元的"是/否",而是一个概率判断。
这意味着存在误报——人类写的文本也可能被判定为 AI 生成,尤其是那些语言非常规范、结构非常工整的文字。
在学术和出版场景,误报的后果很严重。一篇论文被误判为 AI 生成,作者可能会被调查。
目前有哪些落地方案
OpenAI:在 GPT-4o 和部分 API 响应中测试水印。OpenAI 官方称,水印不会 100% 可靠,建议作为辅助判断工具。
Google Perplexity:在 AI 生成内容的末尾添加可见的水印标识。用户可以直接看到"此内容由 AI 生成"的标记。
Meta Detect:Meta 开源了检测工具,但同样强调检测准确率不是 100%。
Copyleaks 等商业公司:提供 AI 内容检测 API,结合水印检测、风格分析、 perplexity 分析等多种方法。
水印技术的真实局限
总结一下水印目前的短板:
- 可绕过:改写、翻译、摘要都能削弱水印信号
- 误报:人类写得好,也可能被误判
- 密钥风险:一旦泄露,整个系统可信度归零
- 跨语言失效:大多数水印方案针对英文设计,其他语言效果打折
- 不是银弹:单独用水印检测,准确率远低于宣传
那水印还有什么用
尽管有这些局限,水印技术还是有价值的。
对于大规模自动化内容分发的场景,水印可以快速筛选出大量 AI 生成内容。比如新闻聚合平台、内容农场、垃圾信息检测。
对于透明度要求高的场景,可见水印(比如 Perplexity 的做法)比统计水印更实用——用户一眼就能看到。
对于研究和监管,水印提供了一条可追溯的技术路径。虽然不完美,但比完全没有好。
你应该怎么看
水印是 AI 时代的一个基础设施尝试。
它不是万能的。不能单靠它来判断一段文字是不是 AI 写的。
但它代表了一个方向:让 AI 生成内容可识别、可追溯。
在技术成熟之前,最好的做法是把水印检测当作众多判断依据之一,而不是唯一标准。
另外,如果你是内容创作者,担心自己的文字被误判为 AI 生成,那就写得更"有人味"一点——偶尔的口语化、不完美句式、个人视角的叙述,都是水印检测器难以捕捉的特征。
你觉得水印技术能解决 AI 内容的身份问题吗?还是说,它只是一个心理安慰?