VCR-Bench:面向视频思维链推理的综合评估框架
计算机视觉与模式识别
2025-04-11 v1 人工智能
计算与语言
摘要
思维链推理的进展显著增强了大型语言模型(LLM)和大型视觉语言模型(LVLM)的能力。然而,目前仍然缺乏针对视频 CoT 推理的严格评估框架。现有的视频基准测试无法充分评估推理过程,也无法揭示失败是源于感知能力还是推理能力的不足。因此,我们引入了 VCR-Bench,这是一种旨在全面评估 LVLM 视频思维链推理能力的新型基准测试。VCR-Bench 包含 859 个涵盖多种视频内容和时长的视频,以及 1,034 个高质量的问答对。每个问答对均人工标注了分步 CoT 理据,其中每一步都带有标签以指示其与感知或推理能力的关联。此外,我们设计了七个不同的任务维度,并提出了 CoT 分数,以基于分步标注的 CoT 理据评估整个 CoT 过程。在 VCR-Bench 上的大量实验突出了当前 LVLM 的实质性局限。即使是表现最好的模型 o1,也仅获得了 62.8% 的 CoT 分数和 56.7% 的准确率,而大多数模型的得分低于 40%。实验表明,大多数模型在感知步骤上的得分低于推理步骤,揭示了 LVLM 在处理复杂视频推理的时空信息方面的关键瓶颈。CoT 分数与准确率之间稳健的正相关性证实了我们评估框架的有效性,并强调了 CoT 推理在解决复杂视频推理任务中的关键作用。我们希望 VCR-Bench 能作为一个标准化的评估框架,并暴露复杂视频推理任务中的实际缺陷。
引用
@article{arxiv.2504.07956,
title = {VCR-Bench: A Comprehensive Evaluation Framework for Video Chain-of-Thought Reasoning},
author = {Yukun Qi and Yiming Zhao and Yu Zeng and Xikun Bao and Wenxuan Huang and Lin Chen and Zehui Chen and Jie Zhao and Zhongang Qi and Feng Zhao},
journal= {arXiv preprint arXiv:2504.07956},
year = {2025}
}