中文

DMC-CF:用于因果推理的动态多模态反事实 QA 基准

计算机视觉与模式识别 2026-05-29 v1

摘要

随着多模态大语言模型(MLLMs)的快速发展,模型已显示出日益强大的多模态能力。然而,是否可以通过统计学习训练的 MLLMs 能真正理解现实世界背后的因果关系,仍是一个关键研究问题。近年来,提出了诸多多模态因果推理数据集。然而,这些数据集要么规模有限,要么来自合成图像和视频、卡通内容或其他非真实逼真的多模态来源。为此,我们收集真实世界视频,构建 DMC-CF-Static,用于多模态因果反事实推理的大规模基准。进一步为缓解传统静态评估中如数据污染等问题,我们使用因果图表示因果事件,提出动态图干预(DGI)框架,从DMC-CF-Static构建动态评估基准DMC-CF-Dynamic。在包括静态和动态评估基准的整体DMC-CF上进行实验,结果表明当前多模态大语言模型在真实场景下的多模态因果推理能力仍有大大提升空间。

关键词

引用

@article{arxiv.2605.29339,
  title  = {DMC-CF: Dynamic Multimodal CounterFactual QA benchmark for Causal Reasoning},
  author = {Junzhe Zhang and Huixuan Zhang and Guirong Wang and Xingyao Zhang and Pei Liu and Lin Qu and Hu Wei and Xiaojun Wan},
  journal= {arXiv preprint arXiv:2605.29339},
  year   = {2026}
}