中文

GaussMark:面向语言模型结构式水印的实用方法

密码学与安全 2025-01-27 v1 人工智能 计算与语言 机器学习

摘要

近年来,大型语言模型(LLM)的快速发展在自然语言处理任务中带来了显著的性能提升,但其生成的人类质量文本的能力也引发了在需要识别文本是否由人类生成的场景中存在的伦理和操作性顾虑。因此,近期研究聚焦于开发语言模型水印技术,即引入几乎不可感知的信号,允许具备密钥的提供方确定给定文本是否由其模型生成。当前的水印技术常常在生成延迟、检测时间、文本质量降低或鲁棒性方面存在实际问题。许多缺陷源于关注 token 级别的水印,忽略了文本的内在结构。在本工作中,我们引入了一种新方案 GaussMark,其实现简单且高效,具有对效果的正式统计保证,生成延迟为零,将水印嵌入模型权重本身,从而实现结构式水印。我们的做法基于高斯独立性检验,灵感来自最近的经验观察:对 LLM 权重进行微小的加性扰动可导致质量相同(甚至更好)的模型。在我们表明,通过对给定 LLM 权重添加少量高斯噪声,我们可以以统计学可检测的方式为模型嵌入水印。我们对程序的有效性和检验力提供了正式的统计界限。通过大量实验,我们展示 GaussMark 可靠、高效,且对插入、删除、替换和往返翻译等扰动具有相对较好的鲁棒性,并且几乎不会损失模型质量。

关键词

引用

@article{arxiv.2501.13941,
  title  = {GaussMark: A Practical Approach for Structural Watermarking of Language Models},
  author = {Adam Block and Ayush Sekhari and Alexander Rakhlin},
  journal= {arXiv preprint arXiv:2501.13941},
  year   = {2025}
}