中文

CaST-Bench:用于视频问答的因果链式基准测试

计算机视觉与模式识别 2026-05-25 v1

摘要

因果推理在视频中是 Vision-Language 模型 (VLM) 面临的重大挑战,因为它需要超越表面感知,深入理解因果机制。然而,现有基准测试很少提供精细且有依据的证据,以严格评估这一能力。为填补这一空白,我们引入 CaST-Bench,一个用于因果链式基准测试的时空视频推理基准。CaST-Bench 提出需要模型识别和局部化多个时空证据链的复杂因果问题。通过人类-AI 协作管道,我们构建了一个质量较高的 2,066 个问题数据集,覆盖 1,015 个视频,因果链由时间段和边界框轨迹标注。此外,我们设计了一个全面的评估套件,包含新指标,评估不仅关注答案的正确性,还关注视觉证据的依据推理能力。这种依据化是通过缓解伪相关性提高准确性、增强用户信任的关键因素,使模型更透明。我们的实验表明,当前 VLM 在因果问题上表现不佳,主要due于其有限的构建精确且依据化因果链的能力。这凸显了改进未来 VLM 的重要方向。

关键词

引用

@article{arxiv.2605.23216,
  title  = {CaST-Bench: Benchmarking Causal Chain-Grounded Spatio-Temporal Reasoning for Video Question Answering},
  author = {Mingfang Zhang and Jingjing Pan and Ashutosh Kumar and Rajat Saini and Mustafa Erdogan and Hsuan-Kung Yang and Caixin Kang and Yifei Huang and Yoichi Sato and Quan Kong},
  journal= {arXiv preprint arXiv:2605.23216},
  year   = {2026}
}

备注

CVPR 2026