中文

面向人类编辑的大语言模型水印鲁棒检测

统计方法学 2025-08-28 v3 计算与语言 机器学习 统计理论 机器学习 统计理论

摘要

水印提供了有效区分大语言模型(LLM)生成文本与人类撰写文本的方法。然而,人类编辑在LLM生成文本上的普遍存在会稀释水印信号,从而显著降低现有方法的检测性能。在本文中,我们通过混合模型检测建模人类编辑,引入一种新的检测方法,形式为针对人类编辑下水印文本的截断良好拟合检验,称为Tr-GoF。我们证明,Tr-GoF检验在显著文本修改且水印信号消失的渐近 regime中,对Gumbel-max水印实现鲁棒检测的最优性。重要的是,Tr-GoF以自适应方式实现此最优性,因为它无需精确知道人类编辑水平或LLM的概率规范,与Neyman-Pearson似然比检验相对,后者虽然最优但实用性差。此外,我们建立Tr-GoF检验在中等文本修改 regime中实现最高检测效率率。 starkly相反,我们表明,由于统计量的加性特性不够抗edit-induced噪声,sum-based检测规则在两个 regime中均未实现最优鲁棒性。最后,我们在合成数据和开源LLM(OPT和LLaMA系列)上演示了Tr-GoF检验的具竞争力且有时优于现有方法的实证性能。

关键词

引用

@article{arxiv.2411.13868,
  title  = {Robust Detection of Watermarks for Large Language Models Under Human Edits},
  author = {Xiang Li and Feng Ruan and Huiyuan Wang and Qi Long and Weijie J. Su},
  journal= {arXiv preprint arXiv:2411.13868},
  year   = {2025}
}

备注

To appear in Journal of the Royal Statistical Society: Series B