中文

HeavyWater 与 SimplexWater:面向低熵下一 token 预测的无失真 LLM 水印

密码学与安全 2025-12-03 v2 人工智能 计算与语言 计算机与社会 信息论 机器学习 math.IT

摘要

大语言模型 (LLM) 水印用于验证文本来源、遏制机器生成文本的滥用,并促进 AI 系统的可信度。当前水印通过改变 LLM 输出的下一 token 预测来实现,其中的更新后 (即水印化) 预测依赖于由散列先前生成的 token 等随机侧信息产生。LLM 水印在低熵生成任务中尤为具有挑战性——例如编程任务,其中下一 token 预测接近确定性。在本文中,我们提出一种水印设计优化框架。我们的目标是理解如何最有效地利用随机侧信息,以最大化水印检测概率并最小化生成文本的失真。我们的分析指导了两种新水印的设计:HeavyWater 与 SimplexWater。两种水印都可调节,能在检测准确性和文本失真之间优雅地进行权衡。它们还可以适用于任何 LLM,且对侧信息生成方式具有不依赖性。我们通过多个基准测试评估了 HeavyWater 与 SimplexWater 的性能,展示了它们在低熵情境下能够以最小程度的文本生成质量妥协实现高水印检测准确性。我们的理论分析还揭示了 LLM 水印与编码理论之间的惊人新联系。代码实现可在 https://github.com/DorTsur/HeavyWater_SimplexWater 查阅。

关键词

引用

@article{arxiv.2506.06409,
  title  = {HeavyWater and SimplexWater: Distortion-Free LLM Watermarks for Low-Entropy Next-Token Predictions},
  author = {Dor Tsur and Carol Xuan Long and Claudio Mayrink Verdun and Hsiang Hsu and Chen-Fu Chen and Haim Permuter and Sajani Vithana and Flavio P. Calmon},
  journal= {arXiv preprint arXiv:2506.06409},
  year   = {2025}
}

备注

Presented at NeurIPS2025