中文

MMD-Thinker:用于多模态虚假信息检测的自适应多维思考

计算机视觉与模式识别 2025-11-18 v1

摘要

在AI生成内容(AIGC)时代,各种社交媒体上的多模态虚假信息数量激增且持续演变。创建成本低且欺骗性强的新型虚假信息构成了重要的社会威胁。虽然最近的研究利用通用型多模态大语言模型(MLLM)在检测方面取得了显著成果,但它们面临两个关键局限性:(1)推理不足,即通用型MLLM常遵循统一的推理范式,生成不准确的解释和判断,由于缺乏针对多模态虚假信息检测的任务特定知识;(2)推理偏见,即单一思考模式使检测器难以提供判断的最佳路径,难以跟上快速增长和复杂的多模态虚假信息。本文提出MMD-Thinker,一个通过自适应多维思考实现多模态虚假信息检测的两阶段框架。首先,我们为多模态虚假信息检测开发定制化思考模式。其次,我们采用任务特定指令调优将定制化思考模式注入通用型MLLM。再次,我们进一步利用带混合优势函数的强化学习策略,以激励轨迹中的推理能力。此外,我们构建了多模态虚假信息推理(MMR)数据集,包含超过8000个带有推理过程和分类标签的图像-文本对,以推动该领域的进展。实验结果表明,我们提出的MMD-Thinker在两个域内和域外基准数据集上实现了最先进的性能,同时保持灵活的推理和令牌使用。代码将在Github上公开。

关键词

引用

@article{arxiv.2511.13242,
  title  = {MMD-Thinker: Adaptive Multi-Dimensional Thinking for Multimodal Misinformation Detection},
  author = {Junjie Wu and Guohong Fu},
  journal= {arXiv preprint arXiv:2511.13242},
  year   = {2025}
}