中文

面向对抗图像编辑的可迁移防御

计算机视觉与模式识别 2026-03-03 v2 人工智能 计算机与社会 机器学习

摘要

最近的研究方法利用输入图像中的不可感知扰动,展示了在抵御基于扩散的图像编辑系统中的恶意操纵方面的潜在 promise。然而,现有方法在跨模型评估中存在 limited 迁移性。为此,我们提出了 Transferable Defense Against Malicious Image Edits (TDAE),一种新型双模框架,通过协调的图像-文本优化来增强图像对恶意编辑的免疫力。具体而言,在视觉防御层面,我们引入了 FlatGrad 防御机制 (FDM),将梯度正则化纳入对抗目标。通过将扰动明确引导至 flat 最近点,FDM 放大了对未知编辑模型的免疫鲁棒性。在文本增强保护方面,我们提出一种名为 Dynamic Prompt Defense (DPD) 的对抗优化范式,该范式定期细化文本嵌入,以将免疫化图像的编辑结果与原始图像的编辑结果对齐,然后在优化后的嵌入下更新图像。通过对多样化嵌入的迭代对抗更新,DPD 强制生成 seek 更广集合的免疫增强特征的免疫化图像,从而实现跨模型迁移性。大量实验结果表明,TDAE 在 both intra- 和 cross-model 评估中在抵御恶意编辑方面实现了 state-of-the-art 性能。

关键词

引用

@article{arxiv.2512.14341,
  title  = {Towards Transferable Defense Against Malicious Image Edits},
  author = {Jie Zhang and Shuai Dong and Shiguang Shan and Xilin Chen},
  journal= {arXiv preprint arXiv:2512.14341},
  year   = {2026}
}

备注

14 pages, 5 figures, accepted by IEEE TPAMI