中文

超越最后一帧:面向生成式视频推理的数据驱动评估

计算机视觉与模式识别 2026-01-15 v2

摘要

近期视频生成技术的突破展示了一种称为链式帧(Chain-of-Frames, CoF)推理的新兴能力,通过连续帧的生成来解决复杂任务。虽然这些模型在生成式视频推理(GVR)方面显示出前景,但现有的评估框架往往依赖单帧评估,这可能导致结果作弊,即模型通过错误的过程达到正确的结论。为此,我们提出一种数据驱动的评估范式。我们引入VIPER,一个涵盖时序、结构、符号、空间、物理和规划推理等16项任务的综合性基准。此外,我们提出过程-结果一致性(Process-outcome Consistency, POC@r),一种新型指标,该指标利用VLM作为裁判器,并采用分层评分标准来评估中间步骤的有效性以及最终结果。我们的实验表明,最先进的视频模型仅实现约20%的[email protected],并表现出显著的结果作弊。我们进一步探讨了测试时规模和采样鲁棒性的影响,凸显了当前视频生成与真正通用视觉推理之间的重大差距。我们的基准已发布于 https://github.com/RUCAIBox/VIPER。

关键词

引用

@article{arxiv.2512.24952,
  title  = {Beyond the Last Frame: Process-aware Evaluation for Generative Video Reasoning},
  author = {Yifan Li and Yukai Gu and Yingqian Min and Zikang Liu and Yifan Du and Kun Zhou and Min Yang and Wayne Xin Zhao and Minghui Qiu},
  journal= {arXiv preprint arXiv:2512.24952},
  year   = {2026}
}

备注

Work in progress