MME-CoF-Pro:基于文本与视觉提示评估视频生成模型的推理连贯性
计算机视觉与模式识别
2026-03-23 v1
摘要
视频生成模型展现出新兴的推理行为。确保生成事件在帧之间保持因果一致性对于可靠部署至关重要,这一属性我们定义为推理连贯性。为弥合文献中缺乏推理连贯性评估的空白,我们提出MME-CoF-Pro,一个全面的视频推理基准,用于评估视频模型的推理连贯性。具体而言,MME-CoF-Pro包含303个样本,覆盖16个类别,从视觉逻辑到科学推理。它引入推理得分(Reasoning Score)作为评估指标,用于衡量过程级必要中间推理步骤,并包含三个评估设置:(a) 无提示(no hint)、(b) 文本提示(text hint)和(c) 视觉提示(visual hint),以受控探究推理提示指导的底层机制。对7个开放和封闭源视频模型的评估结果揭示了包括:(1)视频生成模型表现出较弱的推理连贯性,与生成质量分离;(2)文本提示虽提升表观正确性,却常导致不一致和幻觉推理;(3)视觉提示有助于结构感知任务,但在细粒度感知方面仍有挑战。网站:https://video-reasoning-coherence.github.io/
引用
@article{arxiv.2603.20194,
title = {MME-CoF-Pro: Evaluating Reasoning Coherence in Video Generative Models with Text and Visual Hints},
author = {Yu Qi and Xinyi Xu and Ziyu Guo and Siyuan Ma and Renrui Zhang and Xinyan Chen and Ruichuan An and Ruofan Xing and Jiayi Zhang and Haojie Huang and Pheng-Ann Heng and Jonathan Tremblay and Lawson L. S. Wong},
journal= {arXiv preprint arXiv:2603.20194},
year = {2026}
}