CausalStep:面向视频中显式逐步因果推理的基准
计算机视觉与模式识别
2025-07-24 v1 人工智能
摘要
大语言模型(LLM)的最新进展提升了文本与图像领域的推理能力,但实现稳健的视频推理仍是一项重大挑战。现有视频基准主要评估浅层的理解与推理,并允许模型利用全局上下文,未能严格评估真正的因果与逐步推理。我们提出 CausalStep,一个专为视频中显式逐步因果推理设计的基准。CausalStep 将视频分割为因果相连的单元,并强制执行严格的逐步问答(QA)协议,要求按顺序作答以防止捷径解。每个问题均包含基于错误类型分类法精心构建的干扰项,以确保诊断价值。该基准包含横跨六个类别的 100 个视频和 1,852 个多项选择 QA 对。我们引入七个诊断指标进行全面评估,实现对因果推理能力的精确诊断。在领先的专有与开源模型以及人类基线上的实验表明,当前模型与人类水平的逐步推理之间存在显著差距。CausalStep 为推动稳健且可解释的视频推理提供了严格的基准。
引用
@article{arxiv.2507.16878,
title = {CausalStep: A Benchmark for Explicit Stepwise Causal Reasoning in Videos},
author = {Xuchen Li and Xuzhao Li and Shiyu Hu and Kaiqi Huang and Wentao Zhang},
journal= {arXiv preprint arXiv:2507.16878},
year = {2025}
}
备注
Preprint, Under review