中文

面向语言模型的水印平滑攻击

机器学习 2025-02-06 v2

摘要

水印是检测AI生成文本的关键技术。本文研究了其漏洞,介绍了一种新颖的水印消除方法——平滑攻击。通过利用模型置信度与水印可检测性之间的关系,攻击方法有选择地平滑水印内容,从而消除水印痕迹而不影响文本质量。我们在10种不同的水印上,对参数范围从13亿到30亿的开源模型上验证了该攻击的有效性。我们的发现揭示了现有水印方案的关键弱点,凸显了需要更强防御的重要性。

关键词

引用

@article{arxiv.2407.14206,
  title  = {Watermark Smoothing Attacks against Language Models},
  author = {Hongyan Chang and Hamed Hassani and Reza Shokri},
  journal= {arXiv preprint arXiv:2407.14206},
  year   = {2025}
}