中文

ROVER:面向全模态生成的互惠跨模态推理基准

计算机视觉与模式识别 2025-11-04 v1

摘要

统一多模态模型(unified multimodal models, UMMs)已成为无缝统一文本与图像理解与生成的强大范式。然而,主流评测将这些能力割裂开来:多模态输入与输出的任务主要通过单模态推理进行评分,即文本基准侧重基于语言的推理,而视觉基准侧重体现在像素中的推理结果。我们提出 ROVER,以应对测试互惠跨模态推理——即利用一种模态来引导、验证或精炼另一种模态的输出——这一统一多模态智能愿景中的核心能力的迫切需求。ROVER 是一个人工标注的基准,显式针对互惠跨模态推理,包含基于 1876 张图像构建的 1312 个任务,涵盖两种互补的设置:面向视觉生成的言语增强推理评估模型能否利用言语提示与推理链来引导忠实的图像合成;面向言语生成的视觉增强推理评估模型能否生成中间可视化以强化其自身的问答推理过程。对 17 个统一模型的实验揭示了两项关键发现:(i) 跨模态推理决定视觉生成质量,交错模型显著优于非交错模型;值得注意的是,组合强大的单模态模型无法取得相当的推理能力。(ii) 模型在物理推理与符号推理之间表现出分离:它们能够字面地解释感知概念,但无法为符号任务构建视觉抽象,而有缺陷的推理会损害性能。这些结果凸显了互惠跨模态推理作为实现真正全模态生成的关键前沿。

关键词

引用

@article{arxiv.2511.01163,
  title  = {ROVER: Benchmarking Reciprocal Cross-Modal Reasoning for Omnimodal Generation},
  author = {Yongyuan Liang and Wei Chow and Feng Li and Ziqiao Ma and Xiyao Wang and Jiageng Mao and Jiuhai Chen and Jiatao Gu and Yue Wang and Furong Huang},
  journal= {arXiv preprint arXiv:2511.01163},
  year   = {2025}
}

备注

Project Page: https://roverbench.github.io/