刚刚,ChatGPT生成的文字中,开始逐个词汇“嵌入隐藏标记”了!
这项水印技术名为textGrain。模型每挑选一个词语,都会暗中加入一把仅OpenAI知晓的密钥。
肉眼无法察觉任何异样,读起来与以往毫无区别,但检测器一扫描,立刻能判断这段话是否出自OpenAI的模型。
从此,你让AI代写的作业、简历、周报,只要直接复制粘贴,就可能被当场识别出来。
重点来了,这次发布最关键的有四点。
1. 立即生效:全球API客户今天就能自行启用水印,ChatGPT和Codex也将在未来几周陆续接入。
2. 检测率高:误报率控制在1%时,一段400个token的心理学类回答,超过九成能被检出。OpenAI还宣称,效果媲美甚至超越谷歌的SynthID。
3. 性能几乎无影响:旗舰模型GPT-6 Astra加入水印后,8项核心跑分基本持平,其中5项甚至略有提升。
4. 检测权限受控:检测器暂不对公众开放,仅提供给审核通过的研究者和专业机构,而textGrain本身将开源。
AI写作的“实名制时代”,正式拉开序幕。
至此,谷歌、Anthropic、OpenAI三巨头,全部为AI生成的文字装上了“身份标识”。
大模型生成文字时,每次只输出一个词。输出前,它会为所有候选词分配概率,再按概率随机选取一个。
例如,“The morning was ”(早上天气很_)后面,“warm”占30%,“cold”占25%,其余词汇分配剩下的比例。
水印要做的,就是让这个随机选择过程悄悄遵循密钥的指令。
但有一条规则不能违背,称为“无偏”。将所有可能的密钥平均后,每个词被选中的概率必须与原来完全一致。
这样,不知道密钥的人看到的仍是正常的随机文字,模型想表达的内容也丝毫不变。
当年Scott Aaronson在OpenAI开发的第一版水印,满足了无偏,却留下一个缺陷——
同一个问题、同一把密钥,模型每一步都会选同一个词,同一个问题问十遍,答案可能一字不差。
而textGrain的解决方案,源于一个近250年历史的数学问题,最优传输。
它的起点,确实是“搬运泥土”。
1781年,法国数学家蒙日思考过一个具体问题:一堆土要填进另一个坑,每一份土运到哪儿,总运费才最低。
到了20世纪40年代,苏联数学家康托洛维奇放宽了问题,一份土可以拆分运往多个地点,只要总量匹配。搬运问题由此转化为线性规划。
康托洛维奇后来因最优资源配置理论,与库普曼斯共同获得1975年诺贝尔经济学奖。
巧合的是,库普曼斯正是耶鲁的经济学家,而这篇技术报告的作者之一、耶鲁经济学家陈晓红,如今坐的就是以他命名的讲席。
再往后,2010年菲尔兹奖得主维拉尼将最优传输与几何、概率、偏微分方程联系起来。
2013年,Marco Cuturi引入熵正则化和Sinkhorn算法,大幅降低了计算成本,最优传输才成为机器学习中的常用工具。
两个多世纪后,textGrain将这条数学链条引入大模型。只不过这一次,被搬运的对象变成了下一个词的概率。
textGrain的核心思路,是为水印设定一笔“随机性预算”。
论文证明了一个恒等式:水印让选词与密钥之间增加的关联,恰好等于模型平均损失的随机性,两者是同一个量。
水印获得多少统计关联,就要付出多少随机性,分毫不差。
于是OpenAI可以事先设定一个比例,规定水印最多消耗原本随机性的多少。例如设为0.2,平均至少保留八成随机性,确保回答的多样性。
具体过程分为三步。
第一步,密钥结合前文,将候选词随机分成几组,每组概率相加。
图中的六个词被分成三组,“warm、calm”占0.40,“cold、sunny”占0.35,“mild、bright”占0.25。分组后只需在几个组之间分配概率。
第二步,OpenAI相当于准备了4套“偏心”方案,图中的4列就是这些方案。
密钥为每个“组×方案”的格子生成随机分数,再通过带熵约束的最优传输,利用Sinkhorn算法反复调整行和列,将概率尽量向高分格子移动,直到预算用完。
每套方案各偏向不同的组,4套平均后,每组的概率仍是0.40、0.35、0.25,无任何偏向。
第三步,密钥选中其中一套。图中选中的是第2列,“cold、sunny”这组的概率从0.35提升至0.69。
再在组内按原来25比10的比例选词,最终写下了“cold”。
不知道密钥的人,看到的是一次正常的随机选择;手握密钥的人,知道这一步本该偏向哪一组。
检测时,只需回答一个问题:这段文字的选词,是否总是“碰巧”符合密钥指定的偏好。
普通人写的文字与密钥无关,每个位置的分数都是纯随机的,总分落在哪个范围,可用现成的概率分布精确算出。
而带水印的文字,会落在高分格子上,因此总分也会异常偏高。
整个检测只需原文和密钥,既无需调用模型,也不用知道生成时的预算设定。
值得一提的是,这种水印并未降低模型性能。
GPT-6 Astra的8项基准中,5项加入水印后反而略有提升,下降最多的只有1.12个点;ChatGPT内的测试也显示,用户的“点踩率”几乎没有变化。
这份20页的技术报告,作者栏中有4位高校学者。9位作者的背景涵盖统计学、经济学、优化和机器学习。
第一作者李翔在北大完成统计学本科和博士,导师是张志华,近年专注于大模型文本水印和大模型评估,明年1月将赴罗格斯大学统计系任助理教授。
宾大的龙琦是生物统计学家,中国科大少年班出身,如今执掌宾大生物医学信息学研究所。
耶鲁方面,陈晓红是美国艺术与科学院院士,曾与邹至庄共同获得2017年中国经济学奖。
温刚是耶鲁统计与数据科学系五年级博士生,北大数院本科毕业,主攻高维概率和随机矩阵,2021年起跟随苏炜杰做研究。
OpenAI方面的作者中,Qingquan Song来自基座模型团队,是开源工具Auto-Keras的作者之一;Arzav Jain和Florent Joly都参与过ChatGPT搜索的研发。
其中,串联起这支队伍的,是通讯作者苏炜杰。
他于今年5月正式加入OpenAI,同时仍是宾大沃顿商学院统计与数据科学系教授。
苏炜杰是北大数院07级学生,在北大时专业成绩年级第一,还获得过首届丘成桐大学生数学竞赛全能金牌。之后,他赴斯坦福攻读统计学博士,师从Emmanuel Candès。
他的研究涵盖统计机器学习、高维推断、优化和隐私保护,ICML 2023还曾用他提出的“保序机制”进行实验,让作者为自己的投稿排序,用于校准审稿分数。
今年2月他获得COPSS会长奖时,颁奖词第一条就是生成式AI的统计基础,其中包含水印方面的研究。
原理讲完,回到大家最关心的问题:自己用AI写的内容,会不会被查出。
原样照抄的,确实有风险。几百个词连在一起,就足以让检测器识别出来。
不过,能检测的人目前还不是你的老师,也不是你的HR。
根据官方公告,OpenAI的检测器只提供给审核通过的研究者,Anthropic的也只对监管、媒体、研究者和教育机构开放。
门虽然还没完全打开,但方向已经明确。
ChatGPT每周有12亿用户,越来越多的文字出自模型,谷歌、Anthropic、OpenAI三家都选择了同一条路,将出处直接嵌入文字本身。
两百多年前用于计算土方运输费用的数学,如今在为机器生成的文字标注来源。
可水印只能证明一段话出自AI,无法证明一段话出自你。
往后,“这是我写的”这句话,可能也需要拿出证据来证明了。
参考资料:
https://openai.com/index/eu-text-provenance/
本文来自微信公众号“新智元”,作者:ASI启示录,编辑:摩西,36氪经授权发布。