中文

面向AI生成文本的可证明鲁棒水印

计算与语言 2023-10-16 v2 机器学习

摘要

我们研究对大语言模型(LLM)生成文本加水印的问题——这是应对LLM使用安全挑战最有前景的方法之一。本文提出一个严格的理论框架来量化LLM水印的有效性与鲁棒性。我们通过将已有方法扩展为简化的固定分组策略,提出了一种鲁棒且高质量的水印方法Unigram-Watermark。我们证明该水印方法享有有保障的生成质量、水印检测的正确性,并且对文本编辑与改写具有鲁棒性。在三个不同LLM与两个数据集上的实验验证了我们的Unigram-Watermark在检测准确率上达到优越表现,且在困惑度上具备可比的生成质量,从而推动LLM的负责任使用。代码见 https://github.com/XuandongZhao/Unigram-Watermark。

关键词

引用

@article{arxiv.2306.17439,
  title  = {Provable Robust Watermarking for AI-Generated Text},
  author = {Xuandong Zhao and Prabhanjan Ananth and Lei Li and Yu-Xiang Wang},
  journal= {arXiv preprint arXiv:2306.17439},
  year   = {2023}
}