中文

世界模拟器能否推理?Gen-ViRe:生成式视觉推理基准

计算机视觉与模式识别 2026-02-13 v3

摘要

虽然链式思维(CoT)提示使 LLM 能够进行精细的符号推理,但它仍局限于离散文本,无法模拟现实世界中受物理规律支配的连续动态。最近涌现出的视频生成模型作为通过链式帧(CoF)推理的潜在世界模拟器——将思考物化为逐帧的视觉序列,其中每一帧代表物理上基于的推理步骤。尽管已有引人注目的演示,但一个挑战仍然存在:现有基准关注保真度或对齐性,无法评估 CoF 推理,从而无法衡量多步规划、算法逻辑或抽象模式外推中的核心认知能力。这一评估缺口阻碍了对模型能力的系统性理解和原则性改进。我们引入 Gen-ViRe(Generative Visual Reasoning Benchmark),一个基于认知科学和现实世界 AI 应用的框架,将 CoF 推理分解为六个认知维度——从感知逻辑到抽象规划——以及 24 个子任务。通过多来源数据策划、最小化提示协议和混合 VLM 辅助评估以及详细的评估标准,Gen-ViRe 首次对视频模型作为推理器进行量化评估。我们的实验在 SOTA 系统上揭示了在视觉质量与实际推理深度之间的显著差异,确立了基准和诊断工具以推动真正的世界模拟器的发展。

关键词

引用

@article{arxiv.2511.13853,
  title  = {Can World Simulators Reason? Gen-ViRe: A Generative Visual Reasoning Benchmark},
  author = {Xinxin Liu and Zhaopan Xu and Ming Li and Kai Wang and Yong Jae Lee and Yuzhang Shang},
  journal= {arXiv preprint arXiv:2511.13853},
  year   = {2026}
}

备注

10 pages