RLSpoofer:用于 LLM 水印欺骗韧性的轻量化评估器
密码学与安全
2026-04-14 v1
摘要
大语言模型(LLM)水印作为检测与归因 AI 生成文本的 promising 方法,然而其对黑箱欺骗的韧性评估仍不足。现有评估方法往往需要大规模数据集且需获取算法内部白箱信息,限制了实际应用。本文从分布角度研究水印对欺骗的韧性。我们首先建立“局部容量瓶颈”,理论刻画在保持语义保真度的 KL 受限局部更新下,可重新分配的概率质量。基于此,我们提出 RLSpoofer,一种基于强化学习的黑箱欺骗攻击,仅需 100 对人类水印改写训练样本,无需访问水印内部或检测器。尽管监督信号稀疏,它使 4B 参数模型在 PF 标记文本上以最小语义偏移实现 62.0% 的欺骗成功率,远超仅训练至 10,000 样本的 baseline 模型的 6%。我们的发现揭示当前 LLM 水印范式的脆弱欺骗韧性,提供轻量化评估框架,强调亟需更 robust 的方案。
引用
@article{arxiv.2604.11546,
title = {RLSpoofer: A Lightweight Evaluator for LLM Watermark Spoofing Resilience},
author = {Hanbo Huang and Xuan Gong and Yiran Zhang and Hao Zheng and Shiyu Liang},
journal= {arXiv preprint arXiv:2604.11546},
year = {2026}
}
备注
28 pages