增强 LLM 抗清洗与欺骗攻击的水印韧性
密码学与安全
2025-12-09 v2 人工智能
摘要
水印是大型语言模型(LLM)防滥用的有前景方法,但仍面临清洗和欺骗攻击的脆弱性。这种脆弱性源于水印窗口大小所固有的权衡:窗口较小可更好地抵抗清洗攻击,但更容易被逆向工程,从而 enables 低成本统计驱动的欺骗攻击。本工作通过引入等效纹理钥匙(equivalent texture keys)的新型机制,打破这一权衡:水印窗口内多个标记可以独立支持检测。基于这种冗余性,我们提出了一种基于子词汇分解等效纹理钥匙(Sub-vocabulary decomposed Equivalent tExture Key, SEEK)的新型水印方案。它实现了对清洗攻击的 Pareto 改进,在不损害对欺骗鲁棒性的前提下,提高了抗清洗能力。实验表明,SEEK 在各种数据集设置下,相较于先前方法,欺骗鲁棒性提升了 +88.2%/+92.3%/+82.0%,清洗鲁棒性提升了 +10.2%/+6.4%/+24.6%。
引用
@article{arxiv.2507.06274,
title = {Enhancing LLM Watermark Resilience Against Both Scrubbing and Spoofing Attacks},
author = {Huanming Shen and Baizhou Huang and Xiaojun Wan},
journal= {arXiv preprint arXiv:2507.06274},
year = {2025}
}