$B^4$:针对 LLM 水印的黑盒擦除攻击
计算与语言
2024-11-08 v3
摘要
水印技术已成为 LLM 生成内容检测中一种突出的技术,通过嵌入不可感知的模式。尽管性能卓越,但其对抗攻击的鲁棒性仍未被充分探索。先前的研究通常考虑灰盒攻击设置,其中水印的具体类型已经已知。有些甚至需要了解水印方法的超参数。这些前提条件在现实场景中是无法实现的。针对更现实的、假设更少的黑盒威胁模型,我们提出了 ,一种对水印的黑盒擦除攻击。具体而言,我们将水印擦除攻击表述为一个约束优化问题,通过两个分布来捕捉其目标:水印分布和保真度分布。该优化问题可以使用两个代理分布近似求解。在12种不同设置上的实验结果表明, 相比其他基线具有优越的性能。
引用
@article{arxiv.2411.01222,
title = {$B^4$: A Black-Box Scrubbing Attack on LLM Watermarks},
author = {Baizhou Huang and Xiao Pu and Xiaojun Wan},
journal= {arXiv preprint arXiv:2411.01222},
year = {2024}
}