论大语言模型水印的可靠性
机器学习
2024-05-03 v4 计算与语言
密码学与安全
摘要
随着 LLM(大语言模型)变得普遍,机器生成的文本有可能以垃圾邮件、社交媒体机器人和无价值内容淹没互联网。水印是一种简单而有效的策略,通过实现对 LLM 生成文本的检测和记录来缓解此类危害。然而一个关键问题仍然存在:在现实环境的真实设定中,水印的可靠性如何?在那里,带水印的文本可能被修改以满足用户需求,或被完全重写以避免检测。我们研究了水印文本在被人类重写、被非水印 LLM 改写或混入较长的手写文档后的鲁棒性。我们发现水印即使在人类和机器改写后仍然可被检测。虽然这些攻击稀释了水印的强度,但改写文本在统计上很可能泄露原始文本的 n-gram 甚至更长片段,从而在观察到足够多 token 时实现高置信度检测。例如,在强人类改写后,当设定 1e-5 假阳性率时,平均观察到 800 个 token 后即可检测到水印。我们还考虑了一系列新的检测方案,这些方案对嵌入大型文档中的短跨度水印文本敏感,并比较了水印相对于其他类型检测器的鲁棒性。
引用
@article{arxiv.2306.04634,
title = {On the Reliability of Watermarks for Large Language Models},
author = {John Kirchenbauer and Jonas Geiping and Yuxin Wen and Manli Shu and Khalid Saifullah and Kezhi Kong and Kasun Fernando and Aniruddha Saha and Micah Goldblum and Tom Goldstein},
journal= {arXiv preprint arXiv:2306.04634},
year = {2024}
}
备注
9 pages in the main body. Published at ICLR 2024. Code is available at https://github.com/jwkirchenbauer/lm-watermarking