分析与评估无偏语言模型水印
密码学与安全
2025-09-30 v1
摘要
验证 AI 生成文本的真实性正变得越来越重要,随着大语言模型的快速发展,无偏水印因能够在不降低质量的前提下保持输出分布而成为一种有前景的 method。然而,近期研究揭示,无偏水印在多次生成过程中会累积分布偏差,且现有鲁棒性评估在不同研究之间不一致。为此,我们引入UWbench——首个专注于原则化评估无偏水印方法的开源基准平台。我们的框架融合了理论与实证贡献:我们提出一种统计量,用于量化多批次分布漂移,证明了在无限查询下,任何无偏水印都不可能完美保持分布的不可避免性,并发展出针对 token 级修改攻击的形式化鲁棒性分析。补充此理论,我们建立了一个三轴评估协议:无偏性、可检测性和鲁棒性,表明 token 修改攻击比释义化方法提供更稳定的鲁棒性评估。总体而言,UWbench 为社区提供了一个标准化和可复现的平台,以推动无偏水印算法的设计与评估。
引用
@article{arxiv.2509.24048,
title = {Analyzing and Evaluating Unbiased Language Model Watermark},
author = {Yihan Wu and Xuehao Cui and Ruibo Chen and Heng Huang},
journal= {arXiv preprint arXiv:2509.24048},
year = {2025}
}