中文

面向 forensic 视觉语言模型的判定-解释一致对抗攻击:JECA^2

计算机视觉与模式识别 2026-05-28 v1

摘要

Forensic vision-language models(forensic VLMs)最近被开发用于检测图像篡改并提供自然语言解释。然而,这些模型针对对抗操纵的鲁棒性尚未得到充分探索。现有对抗攻击通常旨在翻转模型的二元判定,而附带解释可能仍揭示 forensic 线索并与被攻击的判定矛盾。本文研究针对 forensic VLMs 的判定-解释一致对抗攻击,提出了 JECA^2,一种受控白盒红队诊断,联合重定向视觉归因并使文本解释与目标判定一致。在视觉侧,JECA^2 使用 Grad-CAM 指导的扰动将归因从受篡改区域导向良性区域。在文本侧,它在 token-proximity 约束下优化 prompt 嵌入,使其指向符合真实性的语义。实验表明,在白盒威胁设置下,JECA^2 高于实现基线的攻击成功率和自动判定-解释一致性,同时对闭源 VLMs 的迁移虽可测但有限。我们的结果揭示了基于解释的 forensic VLMs 中的一致性失效模式,动机未来超越二元检测准确率的鲁棒性评估。

关键词

引用

@article{arxiv.2605.28609,
  title  = {JECA^2: Judgment-Explanation Consistent Adversarial Attack against Forensic Vision-Language Models},
  author = {Jiachen Qian},
  journal= {arXiv preprint arXiv:2605.28609},
  year   = {2026}
}

备注

37 pages, 6 figures. Includes supplementary material