重新思考黑盒设置下语义水印的伪造攻击:几何失真视角
密码学与安全
2026-06-29 v1 计算机视觉与模式识别
摘要
最近的研究表明,将信息嵌入潜在扩散模型(LDM)初始噪声的语义水印容易受到黑盒伪造攻击。然而,现有方法主要依赖经验证据,缺乏对攻击成功或失败条件的严格理论理解。为弥合这一差距,我们从潜在空间中的率失真角度重新思考此类攻击的本质。我们的分析确定了由于代理模型和目标模型之间的结构不匹配而导致的不可约失真下限,这从根本上限制了伪造水印的保真度。我们进一步将此失真表征为潜在流形上的结构化几何偏差,形式为全局漂移和局部变形,而非随机噪声。利用这些见解,我们提出了一种与方案无关的检测方法,可在水印验证之前区分伪造样本。大量实验证明了我们的方法在各种黑盒场景中的有效性,同时保持了对常见失真的鲁棒性。
引用
@article{arxiv.2606.29807,
title = {Rethinking Forgery Attacks on Semantic Watermarks in Black-Box Settings: A Geometric Distortion Perspective},
author = {Cheng-Yi Lee and Yichi Zhang and Yuchen Yang and Chun-Shien Lu and Jun-Cheng Chen},
journal= {arXiv preprint arXiv:2606.29807},
year = {2026}
}
备注
Accepted at ICML 2026, updated