面向人类编辑的大语言模型水印鲁棒检测
统计方法学
2025-08-28 v3 计算与语言
机器学习
统计理论
机器学习
统计理论
摘要
水印提供了有效区分大语言模型(LLM)生成文本与人类撰写文本的方法。然而,人类编辑在LLM生成文本上的普遍存在会稀释水印信号,从而显著降低现有方法的检测性能。在本文中,我们通过混合模型检测建模人类编辑,引入一种新的检测方法,形式为针对人类编辑下水印文本的截断良好拟合检验,称为Tr-GoF。我们证明,Tr-GoF检验在显著文本修改且水印信号消失的渐近 regime中,对Gumbel-max水印实现鲁棒检测的最优性。重要的是,Tr-GoF以自适应方式实现此最优性,因为它无需精确知道人类编辑水平或LLM的概率规范,与Neyman-Pearson似然比检验相对,后者虽然最优但实用性差。此外,我们建立Tr-GoF检验在中等文本修改 regime中实现最高检测效率率。 starkly相反,我们表明,由于统计量的加性特性不够抗edit-induced噪声,sum-based检测规则在两个 regime中均未实现最优鲁棒性。最后,我们在合成数据和开源LLM(OPT和LLaMA系列)上演示了Tr-GoF检验的具竞争力且有时优于现有方法的实证性能。
引用
@article{arxiv.2411.13868,
title = {Robust Detection of Watermarks for Large Language Models Under Human Edits},
author = {Xiang Li and Feng Ruan and Huiyuan Wang and Qi Long and Weijie J. Su},
journal= {arXiv preprint arXiv:2411.13868},
year = {2025}
}
备注
To appear in Journal of the Royal Statistical Society: Series B