中文

MMGR:多模态生成推理

计算与语言 2025-12-18 v2 计算机视觉与模式识别

摘要

视频基础模型生成视觉上逼真且在时间上连贯的内容,但其作为世界模拟器的可靠性取决于是否捕捉到物理、逻辑和空间约束。现有指标如 Frechet Video Distance (FVD) 强调感知质量,忽略推理失败,包括违反因果性、物理和全局一致性。我们引入 MMGR(Multi-Modal Generative Reasoning Evaluation and Benchmark),这是一种基于五种推理能力的原则性评估框架:物理推理、逻辑推理、3D 空间推理、2D 空间推理和时间推理。MMGR 在三个领域评估生成推理:抽象推理(ARC-AGI、数独)、具身导航(真实 3D 导航与定位)和物理常识(体育与复合交互)。MMGR 应用细粒度指标,需要在视频和图像生成上实现整体正确性。我们对领先视频模型(Veo-3、Sora-2、Wan-2.2)和图像模型(Nano-banana、Nano-banana Pro、GPT-4o-image、Qwen-image)进行基准测试,揭示了这些模型在不同领域之间存在的显著性能差距。模型在物理常识任务上表现中等,但在抽象推理(ARC-AGI 上准确率不足 10%)和具身环境中长期空间规划方面表现较差。我们的分析突显了当前模型的关键局限性,包括对感知数据过度依赖、弱全局状态一致性,以及奖励视觉可信度而非因果正确性的目标。MMGR 提供了一个统一的诊断基准,通向面向推理的生成式世界模型之路。

关键词

引用

@article{arxiv.2512.14691,
  title  = {MMGR: Multi-Modal Generative Reasoning},
  author = {Zefan Cai and Haoyi Qiu and Tianyi Ma and Haozhe Zhao and Gengze Zhou and Kung-Hsiang Huang and Parisa Kordjamshidi and Minjia Zhang and Wen Xiao and Jiuxiang Gu and Nanyun Peng and Junjie Hu},
  journal= {arXiv preprint arXiv:2512.14691},
  year   = {2025}
}

备注

work in progress