中文

DualGuard:双流大语言模型水印防御抄袭与仪表盘攻击

密码学与安全 2026-04-28 v2 计算与语言

摘要

随着云服务的快速发展,大语言模型通过各种 Web 平台变得日益可访问。然而,这种可访问性也带来了日益增加的滥用风险。大语言模型水印已成为有效缓解此类滥用并保护知识产权的有效方法。然而,现有水印算法主要关注抵御抄袭攻击,而忽略了 Piggyback 仪表盘攻击,这些攻击可注入有害内容、破坏水印可靠性并破坏归因信任。为解决这一局限,我们提出 DualGuard,首个能够抵御抄袭和仪表盘攻击的水印算法。DualGuard 采用自适应双流水印机制,根据语义内容动态注入两个互补水印信号。该设计使 DualGuard 不仅能够检测仪表盘攻击,还能追踪其来源,从而确保可靠且可信的水印检测。在多个数据集和语言模型上进行的广泛实验表明,DualGuard 在检测性、鲁棒性、可追溯性和文本质量方面表现出色,有效推动了大语言模型水印在实际应用中的发展。

关键词

引用

@article{arxiv.2512.16182,
  title  = {DualGuard: Dual-stream Large Language Model Watermarking Defense against Paraphrase and Spoofing Attack},
  author = {Hao Li and Yubing Ren and Yanan Cao and Yingjie Li and Fang Fang and Shi Wang and Li Guo},
  journal= {arXiv preprint arXiv:2512.16182},
  year   = {2026}
}

备注

Accepted to ACL 2026 Findings