中文

字符级扰动破坏LLM水印

密码学与安全 2025-09-16 v2 人工智能

摘要

大型语言模型(LLM)水印通过嵌入可检测信号来实现版权保护、滥用预防和内容检测。尽管先前研究通过水印删除攻击评估了鲁棒性,但这些方法往往并非最佳,导致人们误以为有效删除需要大量扰动或强大对手。为弥合这一差距,我们首先形式化了LLM水印的系统模型,刻画了两种受限于对水印检测器访问限制的现实威胁模型。我们随后分析了不同类型的扰动在其攻击范围内的差异,即单次编辑可影响的标记数量。我们观察到,字符级扰动(如拼写错误、交换、删除、同形字)可以通过扰乱分词过程来影响多个标记。我们演示了在最严格的威胁模型下,字符级扰动对于水印删除效果显著优于其他方法。我们进一步提出了基于遗传算法(GA)的引导删除攻击,该算法使用参考检测器进行优化。在实际的威胁模型下,仅利用对水印检测器的有限黑盒查询,我们的方法显示出强大的删除性能。实验确认了字符级扰动的优势以及GA在受现实约束下删除水印的有效性。此外,我们认为在考虑潜在防御时存在对抗困境:任何固定的防御措施都可能被合适的扰动策略所规避。以此为动机,我们提出了一种自适应的复合字符级攻击。实验结果表明,这种方法能够有效地击败防御措施。我们的发现凸显了现有LLM水印方案存在的显著漏洞,凸显了迫切需要开发新型鲁棒机制的紧迫性。

关键词

引用

@article{arxiv.2509.09112,
  title  = {Character-Level Perturbations Disrupt LLM Watermarks},
  author = {Zhaoxi Zhang and Xiaomei Zhang and Yanjun Zhang and He Zhang and Shirui Pan and Bo Liu and Asif Qumer Gill and Leo Yu Zhang},
  journal= {arXiv preprint arXiv:2509.09112},
  year   = {2025}
}

备注

accepted by Network and Distributed System Security (NDSS) Symposium 2026