中文

面向大量自适应用户的语言模型水印

密码学与安全 2024-07-02 v2 人工智能 计算与语言

摘要

我们研究针对语言模型的水印方案并给出可证明的保证。正如我们所展示的,现有工作对自适应提示没有鲁棒性保证:即使用户查询语言模型不止一次(即便是善意的用户也是如此)。且除唯一一个例外(Christ和Gunn,2024)之外,现有工作局限于零位水印:只能检测AI生成文本,但无法从水印中提取额外信息。不幸的是,仅检测AI生成文本可能无法防止未来的滥用。我们引入多用户水印,该方案即使在面对自适应提示时,也能将模型生成文本追溯到单个用户或联合作弊的用户组。我们从不可检测、具有自适应鲁棒性的零位水印方案(并证明了Christ、Gunn和Zamir(2024)的不可检测零位方案具有自适应鲁棒性)构建多用户水印方案。重要的是,我们的方案同时提供零位和多用户保障。它对较短的文本片段检测效果与原始方案相同,并且能将较长的摘录追溯到具体个人。主要技术组件是从零位水印构造消息嵌入水印的方案。我们的工作是语言模型水印领域首个通用的方案间化简。对于此类化简,唯一的挑战在于缺乏一种统一的鲁棒性抽象——即标记文本在编辑后仍可被检测。我们引入一种新的统一抽象,称为AEB鲁棒性。AEB鲁棒性表明,只要经过编辑的文本“足够接近”模型生成输出的多个块,就能检测到水印。

关键词

引用

@article{arxiv.2405.11109,
  title  = {Watermarking Language Models for Many Adaptive Users},
  author = {Aloni Cohen and Alexander Hoover and Gabe Schoenbach},
  journal= {arXiv preprint arXiv:2405.11109},
  year   = {2024}
}

备注

39 pages