隐式熵:面向低熵 LLM 水印的安全与高效方法
计算与语言
2025-05-21 v1 密码学与安全
摘要
基于 logits 的 LLM 水印通过维持绿色和红色 token 列表,在生成过程中增加绿色 token 的概率,从而追踪和验证 AI 生成内容。然而,在低熵场景下,由于输出可预测,若不扰乱自然文本流,难以选择绿色 token。现有方法通过假设访问原始 LLM 来计算熵并仅对高熵 token 进行水印处理,但面临两个主要挑战:(1) 依赖原始 LLM 导致高计算成本和检测延迟;(2) 可能存在模型泄露风险。为此,我们提出一种名为 Invisible Entropy(IE)的水印范式,以提升安全性和效率。无需依赖原始 LLM,IE 引入轻量级特征提取器和熵标签器,预测下一个 token 的熵是否为高熵。进一步基于理论分析,开发自适应阈值导航器,识别熵阈值,使得水印比例随绿色 token 数量增加而降低,从而增强水印文本的自然性并提升检测鲁棒性。在 HumanEval 和 MBPP 数据集上实验表明,IE 参数规模缩小 99%,且性能与最新方法持平。我们的工作引入了低熵水印的安全高效范式。
引用
@article{arxiv.2505.14112,
title = {Invisible Entropy: Towards Safe and Efficient Low-Entropy LLM Watermarking},
author = {Tianle Gu and Zongqi Wang and Kexin Huang and Yuanqi Yao and Xiangliang Zhang and Yujiu Yang and Xiuying Chen},
journal= {arXiv preprint arXiv:2505.14112},
year = {2025}
}