中文

解读扩散模型图像保护方法中的结构扰动

计算机视觉与模式识别 2025-12-10 v1 人工智能 机器学习

摘要

近期图像保护机制如 Glaze 和 Nightshade 引入不可感知的、针对下游文本到图像生成模型设计的对抗性扰动,以干扰其输出。虽然其经验性有效性已为人所知,但这些扰动的内部结构、可检测性及其在不同表征层面的行为仍鲜为人知。本研究提供了一个统一的框架,集成白盒特征空间检查和黑盒信号层面探针,系统性地进行可解释人工智能分析。通过潜在空间聚类、特征通道激活分析、基于遮挡的空间灵敏度映射和频域特征 characterization,我们展示保护机制作为结构化的低熵扰动,紧密耦合于底层图像内容,跨表征、空间和光谱域均如此。受保护的图像保留内容驱动的特征组织,呈现保护特定亚结构,而非引起全局表征漂移。可检测性由扰动熵、空间布局和频率对齐之间的相互作用决定,顺序保护反而放大可检测结构而非抑制其。频域分析显示,Glaze 和 Nightshade 将能量沿主导图像对齐的频率轴重新分配,而非引入扩散噪声。这些发现表明,当前的图像保护通过结构化特征层面变形而非语义错位 operate,解释了为何保护信号虽视觉 subtlety 却始终可被检测到的现象。本工作推进了对对抗性图像保护的可解释性,为面向生成式 AI 系统的未来防御与检测策略提供了设计指引。

关键词

引用

@article{arxiv.2512.08329,
  title  = {Interpreting Structured Perturbations in Image Protection Methods for Diffusion Models},
  author = {Michael R. Martin and Garrick Chan and Kwan-Liu Ma},
  journal= {arXiv preprint arXiv:2512.08329},
  year   = {2025}
}

备注

32 pages, 17 figures, 1 table, 5 algorithms, preprint