面向多模态操纵检测与定位的细粒度多级监督网络
计算机视觉与模式识别
2025-08-05 v1
摘要
检测并定位多模态媒体操纵(Detecting and Grounding Multi-Modal Media Manipulation, DGM)是虚假信息检测的一个分支。不同于传统的二元分类,它包括复杂的子任务,如伪造内容局部化和伪造方法分类。考虑到现有方法往往因忽视不可靠单模态数据导致的错误干扰,以及未为挖掘细粒度篡改痕迹建立全面监督而在性能上受限。本文提出了细粒度多级监督(Fine-grained Multiple Supervisory, FMS)网络, incorporates 类别可靠性监督、单模态内部监督和跨模态监督,以为 DGM 检测提供全面指导。对于类别可靠性监督,我们提出了多模态决策监督纠正(Multimodal Decision Supervised Correction, MDSC)模块。它利用单模态弱监督来纠正多模态决策过程。对于单模态内部监督,我们提出了单模态伪造矢量强化(Unimodal Forgery Mining Reinforcement, UFMR)模块。它从特征层面和样本层面放大真实信息与假信息之间的差异。对于跨模态监督,我们提出了多模态伪造对齐推理(Multimodal Forgery Alignment Reasoning, MFAR)模块。它利用软注意力相互作用,从一致性和不一致性两个角度实现跨模态特征感知,其中我们还设计了交互约束以确保相互作用质量。大量实验表明,FMS 在与最先进方法的比较中表现出优越性能。
引用
@article{arxiv.2508.02479,
title = {Fine-grained Multiple Supervisory Network for Multi-modal Manipulation Detecting and Grounding},
author = {Xinquan Yu and Wei Lu and Xiangyang Luo},
journal= {arXiv preprint arXiv:2508.02479},
year = {2025}
}