OpenAI正式对外宣布, 在其模型所生成的所有文本当中都将内置隐形水印。只需借助于检测器进行简单的一扫, 即可准确判定内容的出处来源。如果使用者将AI代写的作业、简历或者工作周报原样不动地粘贴上去, 那么这些内容很有可能会当场被直接识破揭穿。
即刻生效覆盖范围
这个功能面向全世界的API客户, 现在已经立刻开放了。用户可以根据自己的选择来决定是否开启水印功能。GPT与Codex平台预计在未来数周内陆续完成接入工作, 那时候普通用户同样会受到相应的影响。
到了二零二六年十月这个时间点, 谷歌还有Anthropic这两个公司, 之前已经一个接一个地推出了用来追踪来源的措施方法。
因为这两家都做了这件事, 所以这就意味着现在市场上主要的三大做模型的公司这块儿, 全部都一致行动了, 一致把能够让人看出来文本是从哪里来的这样一个标记, 给它装上了, 用在了它们生成的每一个文本上面。
检出率与误报控制
技术报告里面提到, 当误报率维持在1%的时候, 对于那些长度是400个token的心理学类别的回答内容来说, 被检测出来的概率超过了九成, 只要几百个词连贯地放在一起, 就完全足以触发有效的判定机制。
检测的过程不要求调用原先的那个模型, 它只需要用到原文和密钥这两个东西, 就可以把验证的事给完成, 这一下就让那些机构和学术界的人在审查时候的操作门槛变得低了很多。
性能几乎无损
旗舰模型的GPT-6 Astra加入了水印功能以后, 八项核心基准的跑分结果基本上保持平衡状态, 在这其中还有五项的得分情况甚至还出现了非常微小的上升景象, 整个过程中并没有出现能够被人们直接感知到的质量下降状况。
根据GPT内测数据来看, 用户点踩的情况并没有看到特别明显的改变, 这样的话就可以说明水印这个东西是没有对回答内容的多样性以及是否自然产生那种可以被大家察觉到的影响的。
检测权限与开源计划
目前这个检测器暂时是不向广大的普通公众开放的, 它仅仅是向着那些已经经过了详细审核的研究人员, 以及那些具备相关资质的专业机构去进行发放操作, 这样做的目的是为了让因为滥用或者是尝试绕过检测而带来的风险能够被大幅度的降低。
textGrain水印生成模块将会开源, 这样开发者可以自由地进行集成, 但是呢, 密钥的生成和管理权还是由OpenAI来单独掌握。
技术原理源自最优传输
这个水印机制是借鉴了具有近250年历史的最优传输数学框架来实现的, 它通过 Sinkhorn 算法来把选词概率微调成朝着密钥偏好的方向, 直到预算用尽就停下来。
团队去设定一个随机性的预算比例, 比如说设置成0.2的话, 意思就是保留至少八成的原始随机性。然后那些没有密钥的读者他们看到的文字分布情况就和正常的テキスト没有什么区别了。
作者团队横跨多学科
这份技术报告的页数达到20页, 它是由9位作者合作完成的, 其中的背景涵盖的范围有统计学、经济学、优化以及机器学习这几个方面, 在这之中, 有4位作者是高校的学者。
第一作者李翔, 他在明年的1月份, 会前往罗格斯大学的统计系, 去担任助理教授这个职位, 苏炜杰在今年5月入职了OpenAI, 同时他还是宾大沃顿商学院的教授。
你最近一次使用人工智能直接撰写的内容, 竟然还敢保持原封不动地提交出去吗? 如果你觉得这个情况是有价值的, 请你点击一下赞并且进行分享, 同时在评论区里面畅聊说说你自己内心的真实看法。


