水印受火考验:LLM水印技术的鲁棒性评估
密码学与安全
2025-10-01 v4 计算与语言
机器学习
摘要
已有多种水印方法(“水印器”)被提出以识别LLM生成的文本;然而,由于缺乏统一的评估平台,许多关键问题仍有待深入探索:i) 各种水印器的优势/局限性是什么,尤其是其抗攻击鲁棒性?ii) 各种设计选择如何影响其鲁棒性?iii) 如何在对抗环境中最优地运行水印器?为填补这一空白,我们系统梳理了现有的LLM水印器与水印移除攻击,并绘制了它们的设计空间。随后,我们开发了WaterPark,一个集成了10种最先进水印器和12种代表性攻击的统一平台。更重要的是,通过利用WaterPark,我们对现有水印器进行了全面评估,揭示了各种设计选择对其抗攻击鲁棒性的影响。我们进一步探讨了在对抗环境中运行水印器的最佳实践。我们相信,本研究为当前的LLM水印技术提供了启示,而WaterPark则可作为促进未来研究的宝贵测试平台。
引用
@article{arxiv.2411.13425,
title = {Watermark under Fire: A Robustness Evaluation of LLM Watermarking},
author = {Jiacheng Liang and Zian Wang and Lauren Hong and Shouling Ji and Ting Wang},
journal= {arXiv preprint arXiv:2411.13425},
year = {2025}
}
备注
25 pages. Accepted by The 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025)