中文

WaterPool:一种缓解不可感知性、有效性和鲁棒性之间权衡的水印方法

密码学与安全 2024-05-24 v1 计算与语言

摘要

随着大型语言模型(LLM)在日常生活中的日益普及,人们对其潜在滥用和社会影响产生了担忧。水印技术通过向生成文本中注入模式来追踪特定模型的使用。理想的水印应产生与原始LLM输出几乎无法区分的输出(不可感知性),同时确保高检测率(有效性),即使文本被部分修改(鲁棒性)。尽管已经提出了许多方法,但没有一种方法能同时实现所有三个属性,揭示了固有的权衡。本文利用以密钥为中心的方案,通过将水印分解为两个不同的模块:密钥模块和标记模块,来统一现有的水印技术。通过这种分解,我们首次证明密钥模块是先前方法中权衡问题的主要原因。具体来说,这反映了生成过程中密钥采样空间的规模与检测过程中密钥恢复的复杂性之间的冲突。为此,我们引入了\textbf{WaterPool},一个简单而有效的密钥模块,它保留了不可感知性所需的完整密钥采样空间,同时利用基于语义的搜索来改进密钥恢复过程。WaterPool可以作为插件与大多数水印方法集成。我们在三种著名水印技术上的实验表明,WaterPool显著提升了它们的性能,实现了接近最优的不可感知性,并显著提高了有效性和鲁棒性(KGW提高12.73%,EXP提高20.27%,ITS提高7.27%)。

关键词

引用

@article{arxiv.2405.13517,
  title  = {WaterPool: A Watermark Mitigating Trade-offs among Imperceptibility, Efficacy and Robustness},
  author = {Baizhou Huang and Xiaojun Wan},
  journal= {arXiv preprint arXiv:2405.13517},
  year   = {2024}
}

备注

9 pages