凌晨一点四十,林薇把第七版稿子点了提交,查重百分之八,过了。
第二天上午,系统回她四个字:疑似 AI 生成。
她把修改记录翻出来,从第一版到第七版,时间戳排得整整齐齐,桌角的咖啡杯还没洗。这些东西没处交,系统只给结论,不给理由。
同一周,OpenAI 放出一条消息。未来几周,欧盟地区的 ChatGPT 和 Codex,输出的文字会带上一层看不见的水印,技术名字叫 textGrain,中文一般译作文本粒水印。
一边是“你写的被当成 AI 写的”,一边是“AI 写的要被标出来”。两件事凑在一块,很多人才回过神,认字这件事,机器已经抢着做了。
水印不在字面上,藏在选词里
先讲清它不是什么。它不是往文字尾巴上贴一行小字,那种东西删一下就没了。

textGrain 动手的地方,在模型写字的过程里:模型写一句话,从来没有唯一的标准答案,每一步它都要从一堆候选词里挑一个出来。挑谁,平时由概率说了算。水印做的事,是把这个概率轻轻推一下,让它偏向某个方向。
推得很轻,人眼读不出来,就算你把同一段话反复读上三遍,也找不出哪一个词被人动过手脚。可一段文字足够长,这些偏移会连成一种规律,检测器拿它算一算,符不符合那种规律,就能给个大概的判断。

先只上欧盟,全球不默认
这次的范围写得清楚。地区、人群、时间,一条一条都点了名。
地区上,只在欧盟,配合《欧盟人工智能法案》里对内容透明的那条要求。OpenAI 也讲了,发布的时候不会把水印设成全球默认。
人这边,欧盟地区所有计划里符合条件的 ChatGPT 和 Codex 用户,接下来几周会陆续用上。API 客户另算,从消息发布当天起,全球的 API 客户可以自己选,给部分模型的输出加水印。
还有一个细节值得看。OpenAI 会给研究人员和专家组织开放探测器的访问权限,从当天开始接受申请,一个一个审批。探测器只报告这段文字里有没有 OpenAI 的水印,不报告用户是谁,也不去碰提示词和对话内容。
顺带说一句,为什么先落在欧盟。欧盟那边有一套《人工智能法案》,对 AI 生成内容的透明度有硬性要求,产品想在那儿正常跑,就得让机器写的东西能被识别出来。OpenAI 把水印先铺在欧盟,节奏跟这套规则对得上;欧洲以外暂时不设成默认,等于留了口子,后面怎么推,还要看各地的规矩怎么落。

能读出来,和读得准,是两回事
看到这里,很多人会松一口气:有机器能认出来,那被冤枉的人是不是就有救了。
事情没这么顺。水印认的是自家模型输出的东西,前提是文字里真的埋了那个信号。换成一句人写的话,理论上不该被认出来。
可现实里还有另一类工具。那些所谓的 AI 检测器,靠的是猜,猜句子顺不顺、用词匀不匀、标点齐不齐。它们和水印是两码事,却常常被摆在一起用。
这类检测器的思路,大体是拿一批已知的 AI 文稿和一批已知的人写文稿去训练,让模型记住两边的差别,来一份新的就归到某一边。问题在于,人写文章本来就没有统一的样子,有人爱用短句,有人一句话绕三道弯,有人标点随手一打。这些习惯放进统计里,和 AI 留下的痕迹有重叠的地方,重叠的那一片,恰好是误判最容易发生的地方。
换个角度想,平台这边也有难处。内容一天几百万条,靠人一条一条看是不现实的,能自动识别的工具,它们当然愿意用;可真要按检测结果下手,限流、降权、退回,受伤的往往是写作者自己。工具给的只是一个概率,落到操作上,常常变成一句话就定了生死。
麻烦就麻烦在这儿。

于是就有了开头那一幕。一个改了七版的人,被一个只会算概率的工具判了刑。
埋在字里的记号,量不出人的分量
水印这门手艺,方向是对的。AI 大规模生成内容,总得有人能分辨,平台要合规,读者要知情,研究者还得能验证。这个需求真实存在。
可技术管得住机器,管不住坐在机器对面的那个人。工具能算出概率,算不出一个人为什么愿意把一句话删掉重写三遍。
一个人熬夜改稿,划掉重写,删了又加,这些动作留在文档的修改记录里,留在桌边那摞废稿里,留在手边那杯凉掉的咖啡里。它们一样是证据,只是没有一种检测器愿意读。机器能读出谁在什么概率下选了哪个词,读不出一个人在深夜改到第七遍时,脑子里翻的是哪一句话。

所以水印越普及,越能反衬出一件事。识别 AI 的手段在变强,而证明一个人是自己写的,门槛还停在原处。
以后写字,顺手留个痕
不劝谁焦虑,就给三个能马上做的动作。
第一,写东西的时候别关修改记录,云端文档一般都会存历史版本,那是你最好的自证材料,出问题了直接导出。
第二,重要的稿子,保留大纲和草稿,存进一个固定文件夹,别嫌乱。
第三,真被误判了,别自己闷着。向平台要具体依据,要检测工具的名字和版本。你不需要证明自己不是 AI,你有权先问它凭什么下结论。
这三条都不难。

那行不起眼的水印,最终提醒的是一件很朴素的事。当机器写的东西越来越像人写的,人得学会把“写过”这件事留下痕迹。
你被 AI 检测误判过吗?说出来,给下一个被冤枉的人留个参照。