中文

面向AI生成内容潜在水印的删除攻击与防御

密码学与安全 2025-11-13 v3

摘要

数字水印可通过初始化生成过程以来自保密分布的起始点来嵌入AI生成内容(AIGC)。当结合伪随机纠错码时,水印化输出可在肉眼不可辨别的情况下保持稳健性,同时抵抗白噪声攻击。本文超越不可辨别性,探讨了针对删除攻击的安全性。我们展示了仅凭不可辨别性并不一定能保证对抗性删除的抵抗力。具体而言,我们提出了一种新型攻击,利用水印化对象的位置泄露的边界信息。这一攻击在特定设置下,将删除水印所需的扰动幅度降低约15倍。为缓解此类攻击,我们引入一种防御机制,应用保密变换以隐藏边界,证明该保密变换有效地使任何攻击者的扰动等价于朴素的白噪声对手。我们的实证评估在多个版本的Stable Diffusion上进行,验证了攻击和提出防御的有效性,凸显了在潜在水印方案中处理边界泄露的重要性。

关键词

引用

@article{arxiv.2509.11745,
  title  = {Removal Attack and Defense on AI-generated Content Latent-based Watermarking},
  author = {De Zhang Lee and Han Fang and Hanyi Wang and Ee-Chien Chang},
  journal= {arXiv preprint arXiv:2509.11745},
  year   = {2025}
}