视频模型是否已准备好作为零样本推理者?基于MME-CoF基准的实证研究
计算机视觉与模式识别
2025-10-31 v1 人工智能
计算与语言
摘要
最新的视频生成模型能够生成高保真、时序连贯的视频,表明它们可能编码了大量世界知识。除了真实合成之外,它们还表现出表明视觉感知、建模和操作能力的新兴行为。然而,一个重要问题仍未解答:视频模型是否已准备好在具有挑战性的视觉推理情景中作为零样本推理者?本文开展了一项全面实证研究以系统性地探讨这一问题,聚焦于领先且流行的Veo-3。我们评估其在12个维度上的推理行为,包括空间、几何、物理、时序和具身逻辑,系统性地刻画其优势与局限。为标准化本研究,我们将评估数据整合到MME-CoF中,该基准为Chain-of-Frame(CoF)推理提供了深入且彻底的评估。我们的发现表明,尽管当前视频模型在短时程空间一致性、细粒度定位和局部一致动力学方面表现出有前景的推理模式,但在长时程因果推理、严格几何约束和抽象逻辑方面仍受限。总体而言,当前视频模型尚不够可靠可作为独立的零样本推理者,但作为配合专门推理模型的补充视觉引擎,展现了令人鼓舞的潜力。项目页面:https://video-cof.github.io
引用
@article{arxiv.2510.26802,
title = {Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark},
author = {Ziyu Guo and Xinyan Chen and Renrui Zhang and Ruichuan An and Yu Qi and Dongzhi Jiang and Xiangtai Li and Manyuan Zhang and Hongsheng Li and Pheng-Ann Heng},
journal= {arXiv preprint arXiv:2510.26802},
year = {2025}
}
备注
Project Page: https://video-cof.github.io