培育通用多模态操纵检测的法医推理能力
计算机视觉与模式识别
2026-05-19 v2
摘要
近期生成式AI的进步显著提升了多模态媒体操纵的逼真度,给操纵检测带来了重大挑战。现有操纵检测与 grounding 方法主要聚焦于结果导向的监督下进行操纵类型分类,这不仅缺乏可解释性,而且容易对浅层痕迹过拟合。本文认为,通用检测需要包含明确的法医推理,而非仅对有限的操纵类型进行分类,这无法泛化到未见的操纵模式。为此,我们提出 REFORM,一个以推理为导向的框架,将学习从结果拟合转向过程建模。REFORM 采用三个阶段的课程学习:首先诱导出法医理由,然后将推理与最终判断对齐,最后通过强化学习实现逻辑一致性。为支持这一范式,我们引入 ROM 数据集,包含丰富的推理注释。大量实验表明,REFORM 在 ROM 上实现了81.52%的准确率,在 DGM4 上达到76.65%,在 MMFakeBench 上达到74.9 F1分数, establishing 新的状态-of-the-art性能并具备优异的泛化能力。
引用
@article{arxiv.2603.01993,
title = {Cultivating Forensic Reasoning for Generalizable Multimodal Manipulation Detection},
author = {Yuchen Zhang and Yaxiong Wang and Kecheng Han and Yujiao Wu and Lianwei Wu and Li Zhu and Zhedong Zheng},
journal= {arXiv preprint arXiv:2603.01993},
year = {2026}
}
备注
Accepted to ACL 2026