单篇博客详情

首页 / 单篇博客

刚刚,ChatGPT生成的文字中,开始逐个词汇“嵌入隐藏标记”了!

这项水印技术名为textGrain。模型每挑选一个词语,都会暗中加入一把仅OpenAI知晓的密钥。

肉眼无法察觉任何异样,读起来与以往毫无区别,但检测器一扫描,立刻能判断这段话是否出自OpenAI的模型。

从此,你让AI代写的作业、简历、周报,只要直接复制粘贴,就可能被当场识别出来。

重点来了,这次发布最关键的有四点。

1. 立即生效:全球API客户今天就能自行启用水印,ChatGPT和Codex也将在未来几周陆续接入。

2. 检测率高:误报率控制在1%时,一段400个token的心理学类回答,超过九成能被检出。OpenAI还宣称,效果媲美甚至超越谷歌的SynthID。

3. 性能几乎无影响:旗舰模型GPT-6 Astra加入水印后,8项核心跑分基本持平,其中5项甚至略有提升。

4. 检测权限受控:检测器暂不对公众开放,仅提供给审核通过的研究者和专业机构,而textGrain本身将开源。

AI写作的“实名制时代”,正式拉开序幕。

至此,谷歌、Anthropic、OpenAI三巨头,全部为AI生成的文字装上了“身份标识”。

1781年的搬运难题,被引入ChatGPT

大模型生成文字时,每次只输出一个词。输出前,它会为所有候选词分配概率,再按概率随机选取一个。

例如,“The morning was ”(早上天气很_)后面,“warm”占30%,“cold”占25%,其余词汇分配剩下的比例。

水印要做的,就是让这个随机选择过程悄悄遵循密钥的指令。

但有一条规则不能违背,称为“无偏”。将所有可能的密钥平均后,每个词被选中的概率必须与原来完全一致。

这样,不知道密钥的人看到的仍是正常的随机文字,模型想表达的内容也丝毫不变。

当年Scott Aaronson在OpenAI开发的第一版水印,满足了无偏,却留下一个缺陷——

同一个问题、同一把密钥,模型每一步都会选同一个词,同一个问题问十遍,答案可能一字不差。

而textGrain的解决方案,源于一个近250年历史的数学问题,最优传输。

它的起点,确实是“搬运泥土”。

1781年,法国数学家蒙日思考过一个具体问题:一堆土要填进另一个坑,每一份土运到哪儿,总运费才最低。

到了20世纪40年代,苏联数学家康托洛维奇放宽了问题,一份土可以拆分运往多个地点,只要总量匹配。搬运问题由此转化为线性规划。

康托洛维奇后来因最优资源配置理论,与库普曼斯共同获得1975年诺贝尔经济学奖。

巧合的是,库普曼斯正是耶鲁的经济学家,而这篇技术报告的作者之一、耶鲁经济学家陈晓红,如今坐的就是以他命名的讲席。

再往后,2010年菲尔兹奖得主维拉尼将最优传输与几何、概率、偏微分方程联系起来。

2013年,Marco Cuturi引入熵正则化和Sinkhorn算法,大幅降低了计算成本,最优传输才成为机器学习中的常用工具。

两个多世纪后,textGrain将这条数学链条引入大模型。只不过这一次,被搬运的对象变成了下一个词的概率。

textGrain的核心思路,是为水印设定一笔“随机性预算”。

论文证明了一个恒等式:水印让选词与密钥之间增加的关联,恰好等于模型平均损失的随机性,两者是同一个量。

水印获得多少统计关联,就要付出多少随机性,分毫不差。

于是OpenAI可以事先设定一个比例,规定水印最多消耗原本随机性的多少。例如设为0.2,平均至少保留八成随机性,确保回答的多样性。

具体过程分为三步。

第一步,密钥结合前文,将候选词随机分成几组,每组概率相加。

图中的六个词被分成三组,“warm、calm”占0.40,“cold、sunny”占0.35,“mild、bright”占0.25。分组后只需在几个组之间分配概率。

第二步,OpenAI相当于准备了4套“偏心”方案,图中的4列就是这些方案。

密钥为每个“组×方案”的格子生成随机分数,再通过带熵约束的最优传输,利用Sinkhorn算法反复调整行和列,将概率尽量向高分格子移动,直到预算用完。

每套方案各偏向不同的组,4套平均后,每组的概率仍是0.40、0.35、0.25,无任何偏向。

第三步,密钥选中其中一套。图中选中的是第2列,“cold、sunny”这组的概率从0.35提升至0.69。

再在组内按原来25比10的比例选词,最终写下了“cold”。

不知道密钥的人,看到的是一次正常的随机选择;手握密钥的人,知道这一步本该偏向哪一组。

检测时,只需回答一个问题:这段文字的选词,是否总是“碰巧”符合密钥指定的偏好。

普通人写的文字与密钥无关,每个位置的分数都是纯随机的,总分落在哪个范围,可用现成的概率分布精确算出。

而带水印的文字,会落在高分格子上,因此总分也会异常偏高。

整个检测只需原文和密钥,既无需调用模型,也不用知道生成时的预算设定。

值得一提的是,这种水印并未降低模型性能。

GPT-6 Astra的8项基准中,5项加入水印后反而略有提升,下降最多的只有1.12个点;ChatGPT内的测试也显示,用户的“点踩率”几乎没有变化。

北大数院校友领衔,宾大耶鲁联手OpenAI

这份20页的技术报告,作者栏中有4位高校学者。9位作者的背景涵盖统计学、经济学、优化和机器学习。

第一作者李翔在北大完成统计学本科和博士,导师是张志华,近年专注于大模型文本水印和大模型评估,明年1月将赴罗格斯大学统计系任助理教授。

宾大的龙琦是生物统计学家,中国科大少年班出身,如今执掌宾大生物医学信息学研究所。

耶鲁方面,陈晓红是美国艺术与科学院院士,曾与邹至庄共同获得2017年中国经济学奖。

温刚是耶鲁统计与数据科学系五年级博士生,北大数院本科毕业,主攻高维概率和随机矩阵,2021年起跟随苏炜杰做研究。

OpenAI方面的作者中,Qingquan Song来自基座模型团队,是开源工具Auto-Keras的作者之一;Arzav Jain和Florent Joly都参与过ChatGPT搜索的研发。

其中,串联起这支队伍的,是通讯作者苏炜杰。

他于今年5月正式加入OpenAI,同时仍是宾大沃顿商学院统计与数据科学系教授。

苏炜杰是北大数院07级学生,在北大时专业成绩年级第一,还获得过首届丘成桐大学生数学竞赛全能金牌。之后,他赴斯坦福攻读统计学博士,师从Emmanuel Candès。

他的研究涵盖统计机器学习、高维推断、优化和隐私保护,ICML 2023还曾用他提出的“保序机制”进行实验,让作者为自己的投稿排序,用于校准审稿分数。

今年2月他获得COPSS会长奖时,颁奖词第一条就是生成式AI的统计基础,其中包含水印方面的研究。

“这是我写的”,开始需要证明

原理讲完,回到大家最关心的问题:自己用AI写的内容,会不会被查出。

原样照抄的,确实有风险。几百个词连在一起,就足以让检测器识别出来。

不过,能检测的人目前还不是你的老师,也不是你的HR。

根据官方公告,OpenAI的检测器只提供给审核通过的研究者,Anthropic的也只对监管、媒体、研究者和教育机构开放。

门虽然还没完全打开,但方向已经明确。

ChatGPT每周有12亿用户,越来越多的文字出自模型,谷歌、Anthropic、OpenAI三家都选择了同一条路,将出处直接嵌入文字本身。

两百多年前用于计算土方运输费用的数学,如今在为机器生成的文字标注来源。

可水印只能证明一段话出自AI,无法证明一段话出自你。

往后,“这是我写的”这句话,可能也需要拿出证据来证明了。

参考资料:

https://openai.com/index/eu-text-provenance/

https://cdn.openai.com/pdf/e9508624-d767-41b6-a26d-e34ca798ada6/textgrain-entropy-calibrated-watermarking-for-language-model-text.pdf

本文来自微信公众号“新智元”,作者:ASI启示录,编辑:摩西,36氪经授权发布。

浙ICP备2020179173号
爱游戏网址科技有限公司品质,始终如一电话:+86 159 6013 5069邮箱:[email protected]杭州市西湖区文三路190号