中文

利用颜色感知替换绕过 LLM 水印

密码学与安全 2024-03-25 v1 计算机视觉与模式识别 机器学习

摘要

水印方法被提出用于识别流传的文本是由人类还是大型语言模型(LLM)生成的。Kirchenbauer 等人 (2023a) 提出的最先进水印策略通过偏置 LLM 来生成特定的(“绿色”)词元。然而,确定该水印方法的鲁棒性仍是一个开放问题。现有的攻击方法无法在较长的文本段上规避检测。我们克服了这一局限,提出了基于自我颜色测试的替换(SCTS),这是首个“颜色感知”攻击。SCTS 通过策略性地提示带水印的 LLM 并比较输出词元频率来获取颜色信息。它利用这些信息确定词元颜色,并将绿色词元替换为非绿色词元。在我们的实验中,SCTS 使用比相关工作更少的编辑次数便成功规避了水印检测。此外,我们从理论和实验两方面证明,SCTS 能够移除任意长度带水印文本中的水印。

关键词

引用

@article{arxiv.2403.14719,
  title  = {Bypassing LLM Watermarks with Color-Aware Substitutions},
  author = {Qilong Wu and Varun Chandrasekaran},
  journal= {arXiv preprint arXiv:2403.14719},
  year   = {2024}
}