中文

MIGA:针对去噪模型语义篡改的互信息引导攻击

计算机视觉与模式识别 2025-03-12 v2

摘要

基于深度学习的去噪模型已广泛应用于视觉任务中,作为滤除噪声同时保留关键语义信息的滤波器。此外,它们在防御威胁下游任务的对抗扰动方面也发挥着至关重要的作用。然而,由于依赖于特定的噪声假设,这些模型本质上可能易受对抗攻击。现有针对去噪模型的攻击主要旨在降低视觉清晰度而忽略语义篡改,使其要么容易被检测到,要么效果有限。在本文中,我们提出了互信息引导攻击(MIGA),这是首个通过对抗扰动策略性地破坏去噪模型保留语义内容的能力,从而直接攻击深度去噪模型的方法。通过最小化原始图像与去噪图像之间的互信息(一种语义相似性的度量),MIGA 迫使去噪器产生视觉上干净但在语义上发生改变的输出。虽然这些图像看起来视觉上合理,但它们编码了系统性扭曲的语义,揭示了去噪模型的一个基本漏洞。这些扭曲在去噪输出中持续存在,并可通过下游任务表现进行定量评估。我们提出了新的评估指标,并在五个数据集上对四种去噪模型系统评估了 MIGA,证明了其在破坏语义保真度方面的一致有效性。我们的研究结果表明,去噪模型并非总是鲁棒的,在实际应用中可能会引入安全风险。

关键词

引用

@article{arxiv.2503.06966,
  title  = {MIGA: Mutual Information-Guided Attack on Denoising Models for Semantic Manipulation},
  author = {Guanghao Li and Mingzhi Chen and Hao Yu and Shuting Dong and Wenhao Jiang and Ming Tang and Chun Yuan},
  journal= {arXiv preprint arXiv:2503.06966},
  year   = {2025}
}