SSG:面向 LLM 水印的 logit 均衡词汇分区
密码学与安全
2026-04-27 v1 人工智能
计算与语言
摘要
水印技术已成为追踪大语言模型(LLM)生成内容作者身份的有前景方法。尽管已有方法多数情况下在自然语言生成中表现出色,但 KGW 方法因其通用性、效率和效果而尤为吸引人。然而,KGW 在低熵环境下(如代码生成和数学推理)的有效性会显著下降。KGW 方法的一个关键步骤是随机词汇分区,这使得可以根据特定偏好调整 token 选择。我们的研究发现,下一个 token 概率分布在决定我们能否修改 token 选择以及随之而来的水印有效性方面起到关键作用。我们将这种特征称为 \emph{watermark strength}。在随机词汇分区情况下,水印强度的下界由下一个 token 概率分布决定。然而,我们发现通过重新设计词汇分区算法,可以潜在提升这一下界。本文提出 SSG(\textbf{S}ort-then-\textbf{S}plit by \textbf{G}roups),一种将词汇划分为两个 logit 均衡子集的方法。这种设计提升了每个 token 预测的水印强度下界,从而改善了水印可检测性。在代码生成和数学推理数据集上的实验表明,SSG 的有效性得到验证。
引用
@article{arxiv.2604.22438,
title = {SSG: Logit-Balanced Vocabulary Partitioning for LLM Watermarking},
author = {Chenxi Gu and Xiaoning Du and John Grundy},
journal= {arXiv preprint arXiv:2604.22438},
year = {2026}
}
备注
ACL 2026 Main Conference