MECD: unlocking 多事件因果发现于视频推理
计算机视觉与模式识别
2024-12-30 v4
摘要
视频因果推理旨在从因果视角理解视频内容。然而,当前的视频推理任务范围有限,主要以问答范式执行,聚焦于仅包含单个事件且具有简单因果关系的短视频,缺乏针对多事件视频的全面且结构化的因果分析。为填补这一空白,我们引入了新任务和数据集,多事件因果发现(MECD)。它旨在揭示分布在长时间视频中、按时间顺序排列的事件之间的因果关系。给定事件的视觉片段和文本描述,MECD需要识别这些事件之间的因果关联,以构建解释最终结果事件为何及如何发生的综合、结构化事件级视频因果图。为解决MECD问题,我们设计了一种受Granger因果方法启发的新型框架,采用高效的掩码-based事件预测模型执行事件Granger检验,通过比较未掩码与被掩码时预测结果事件的差异来估计因果性。此外,我们整合了前导调整和反事实推理等因果推断技术,以解决MECD中的因果混淆和虚假因果等挑战。实验验证了我们框架在提供多事件视频因果关系方面的有效性,相较于GPT-4o和VideoLLaVA分别提升了5.7%和4.1%。
关键词
引用
@article{arxiv.2409.17647,
title = {MECD: Unlocking Multi-Event Causal Discovery in Video Reasoning},
author = {Tieyuan Chen and Huabin Liu and Tianyao He and Yihang Chen and Chaofan Gan and Xiao Ma and Cheng Zhong and Yang Zhang and Yingxue Wang and Hui Lin and Weiyao Lin},
journal= {arXiv preprint arXiv:2409.17647},
year = {2024}
}
备注
Accepted at NeurIPS 2024 as a spotlight paper