中文

MECD+:解锁事件级因果图发现,用于视频推理

计算机视觉与模式识别 2025-10-28 v4

摘要

视频因果推理旨在从因果视角实现对视频的高层次理解。然而,它在范围上存在局限,主要以问答范式执行,聚焦于包含孤立事件和基本因果关系的简短视频片段,缺乏对具有多个相互关联事件的视频进行全面和结构化因果分析。为填补这一空白,我们引入了新的任务和数据集,多事件因果发现(MECD)。它旨在发现分布在长时间视频中跨越事件的因果关系。给定视频片段和事件的文本描述,MECD识别这些事件之间的因果关联,以构建解释结果事件为何及如何发生的综合且结构化的事件级视频因果图。为解决MECD的挑战,我们设计了一个受Granger因果方法启发的新型框架,集成了高效的基于掩码的事件预测模型,以执行事件Granger检验。它通过比较未掩码和掩码前提事件时预测结果事件的差异来估计因果性。此外,我们还整合了front-door调整和反事实推理等因果推断技术,以缓解MECD中的因果混淆和幻觉因果等挑战。此外,还引入了情境链推理,以进行更稳健和更通用的推理。实验验证了我们框架在推理完整因果关系方面的有效性,相较于GPT-4o和VideoChat2分别提升了5.77%和2.70%。进一步的实验表明,因果关系图也有助于下游视频理解任务,如视频问答和视频事件预测。

关键词

引用

@article{arxiv.2501.07227,
  title  = {MECD+: Unlocking Event-Level Causal Graph Discovery for Video Reasoning},
  author = {Tieyuan Chen and Huabin Liu and Yi Wang and Yihang Chen and Tianyao He and Chaofan Gan and Huanyu He and Weiyao Lin},
  journal= {arXiv preprint arXiv:2501.07227},
  year   = {2025}
}

备注

Accepted by IEEE TPAMI (IEEE Transactions on Pattern Analysis and Machine Intelligence). arXiv admin note: substantial text overlap with arXiv:2409.17647