面向语言模型的水印平滑攻击
机器学习
2025-02-06 v2
摘要
水印是检测AI生成文本的关键技术。本文研究了其漏洞,介绍了一种新颖的水印消除方法——平滑攻击。通过利用模型置信度与水印可检测性之间的关系,攻击方法有选择地平滑水印内容,从而消除水印痕迹而不影响文本质量。我们在10种不同的水印上,对参数范围从13亿到30亿的开源模型上验证了该攻击的有效性。我们的发现揭示了现有水印方案的关键弱点,凸显了需要更强防御的重要性。
引用
@article{arxiv.2407.14206,
title = {Watermark Smoothing Attacks against Language Models},
author = {Hongyan Chang and Hamed Hassani and Reza Shokri},
journal= {arXiv preprint arXiv:2407.14206},
year = {2025}
}