朋友收到一封图库网站的邮件,说她三年前上传的几十张风景照,被拿去训练 AI 了。她翻出当年的注册协议,行小字写着:用户授予平台「全球范围内免费使用」的权利。

她愣了半天,回了句:那我拍的照片,到底还是不是我的。

这两天牛津大学那事儿,跟这封邮件是同一个套路。

12.5 万份论文,悄悄成了口粮

博德利图书馆,牛津的心脏,四百多年历史。它把 12.5 万份历史学位论文交给了 OpenAI 做数字化。

公告发出来的时候,措辞很漂亮。扫描、存档、让知识被更多人看见。

教职员一开始挺高兴。老论文能上网,是好事。

可没过多久,有人发现不对劲。这批数字化内容,被用于训练模型了。公告里,一个字没提。

图书馆的回应是:数字化本身不等于训练。

这话没错。但问题是,训练这一步,谁批准的。

一位牛津的教授说了句大实话:我们把书交出去,图的是让人读到,机器拿去吃掉就变了味。

老图书馆的大厅,书还在这里,只是多了一个身份
老图书馆的大厅,书还在这里,只是多了一个身份

这事离你我,没那么远

你可能觉得,牛津的事,跟我有啥关系。

那我问你几个问题。

你手机相册里那几千张照片,存在哪。你写的公众号文章,发在哪个平台。你电脑里那份工作文档,是不是也在某个云盘里躺着。

注册的时候,那份长长的用户协议,你点过「同意」没有。

我同事老周,前阵子翻自己云盘的协议。第八条,第六款,授权平台为了改进服务使用用户内容。

他念完,把手机扣桌上了。

「改进服务」四个字,弹性有多大,谁也说不准。今天的服务是修图,明天的服务,可能是训练。

你随手拍的照片,此刻正躺在某台服务器上
你随手拍的照片,此刻正躺在某台服务器上

数字化和训练,中间隔着一条线

这条线,很多人分不清。

数字化,是把纸上的东西变成电脑里的文件。扫描、存档、上网。这一步,是为了保存和阅读。

训练,是让 AI 把这些东西读进去,学会里面的规律。这一步,是拿去用,拿去生产。

前者像图书馆把书放到书架上,谁都能看。

后者像把书拆开,喂给一台机器,让它照着写新的。

两件事,差距不小。可在很多协议里,这两件事被一句「使用用户内容」打包了。

牛津那批论文的作者们,很多已经去世了。他们没法出来说一句话。

你我还活着,还能问一句。

锁能挡住手,挡不住一行授权条款
锁能挡住手,挡不住一行授权条款
书架还是那个书架,只是喂养的对象变了
书架还是那个书架,只是喂养的对象变了

三条能马上用的自保动作

说回能做的事。不讲大道理,就三条。

第一,重要文件,别只存一份在云上。硬盘、移动盘,本地留一份。云图的是方便,它可算不上保险箱。

第二,发东西前,花两分钟翻协议。找「授权」「使用」「改进服务」「商业用途」这几个词。看不懂就搜。两分钟,换心里踏实。

第三,敏感内容,上传前处理。身份证、合同、带家人的照片,能打码打码,能不传不传。

我朋友后来把那几十张照片从图库删了。删不掉的授权,她认了。但她把手机相册同步关了。

她说:至少以后拍的,我自己说了算。

旧书堆在角落,等着被人读,或者被别的什么读走
旧书堆在角落,等着被人读,或者被别的什么读走

牛津的书还在图书馆里。12.5 万份论文,也还在。只是它们多了一个身份,训练数据。

这个身份,没人问过作者愿不愿意。

你看不见的机房,正把你发出去的东西一份份存起来
你看不见的机房,正把你发出去的东西一份份存起来

你的照片,你的文字,你的文档,现在正躺在某个服务器里。

它们有没有多出别的身份,你查过吗。

查过的,评论区说说结果。没查的,今晚翻翻那份协议。

点个在看,转给那个爱往云盘里塞东西的朋友。