语言模型水印的黑盒检测
密码学与安全
2025-02-25 v3 机器学习
摘要
水印已成为检测LLM生成文本的一种有前景的方法,它通过向LLM生成内容中添加后续可检测的信号来实现。最近的工作提出了多种水印方案家族,其中几个侧重于保持LLM的分布。这种分布保持特性的动机在于,它是保留LLM能力的一个可处理的代理,同时也隐含了下游用户无法检测水印的特性。然而,尽管围绕不可检测性有很多讨论,但之前没有工作研究过任何当前水印方案在现实黑盒设置中的实际可检测性。在这项工作中,我们首次解决了这个问题,开发了严格的统计测试来检测所有三种流行水印方案家族的存在性并估计其参数,仅使用有限数量的黑盒查询。我们通过实验在多种方案和一组多样化的开源模型上证实了我们方法的有效性。此外,我们在真实世界的API上验证了我们测试的可行性。我们的发现表明,当前的水印方案比之前认为的更容易被检测到。
引用
@article{arxiv.2405.20777,
title = {Black-Box Detection of Language Model Watermarks},
author = {Thibaud Gloaguen and Nikola Jovanović and Robin Staab and Martin Vechev},
journal= {arXiv preprint arXiv:2405.20777},
year = {2025}
}
备注
ICLR 2025