中文

更好地理解大语言模型水印的统计问题

机器学习 2026-04-08 v2 密码学与安全 信息论 math.IT 机器学习

摘要

本文研究了大语言模型 (LLM) 水印的问题。我们考虑模型扭曲与检测能力之间的权衡,并基于红绿列表水印算法将其形式化为约束优化问题。我们指出,优化问题的最优解具有良好的分析性质,这为更好地理解和激发水印过程的算法设计提供了依据。我们基于该优化公式开发了一个在线双梯度上升水印算法,并证明了其在模型扭曲与检测能力之间的渐近 Pareto 最优性。该结果明确保证了平均增加的绿色列表概率,从而提高了检测能力(与之前结果不同)。此外,我们对水印问题中模型扭曲度量标准的选择进行了系统性讨论。我们论证了 KL 散度的选择,并指出了现有“无扭曲”和囊惑度标准的局限性。最后,我们在广泛的数据集上对我们的算法进行了实证评估,与基准算法进行了比较。

关键词

引用

@article{arxiv.2403.13027,
  title  = {Towards Better Statistical Understanding of Watermarking LLMs},
  author = {Zhongze Cai and Shang Liu and Hanzhao Wang and Huaiyang Zhong and Xiaocheng Li},
  journal= {arXiv preprint arXiv:2403.13027},
  year   = {2026}
}