中文

IPR-1:交互式物理推理器

人工智能 2026-05-26 v4 计算机视觉与模式识别 机器学习

摘要

人类通过观察、与环境交互并内化物理和因果关系来学习。在此,我们旨在探询智能体是否能类似地通过交互获取类人推理能力并不断提升。为此,我们引入 1000 多款异构游戏的 G2U(Game-to-Unseen)基准,这些游戏在视觉领域存在显著差异。现有方法,包括视觉语言模型(VLM)和世界模型,难以捕捉底层物理和因果机制,因为它们不聚焦于核心机制,过度依赖视觉细节。VLM/VLA 智能体进行推理但缺乏交互环境中的前瞻能力,而世界模型则通过模仿视觉模式来推断,而非分析物理和因果关系。因此,我们提出 IPR(Interactive Physical Reasoner),使用世界模型的 rollout 为 VLM 的策略评分和强化,并引入 PhysCode—a一种物理导向动作代码,将语义意图与动力学对齐,以提供预测与推理的统一动作空间。预训练于 1000 多款游戏后,IPR 在从原始直觉到目标驱动推理的不同水平上表现稳健,甚至超越 GPT-5。我们发现性能随训练游戏数量和交互步数而提升,模型还能零样本迁移到未见游戏。这些结果支持以物理为中心的交互作为逐步提升物理推理能力的途径。更多演示和项目细节请参见 https://mybearyzhang.github.io/ipr-1。

关键词

引用

@article{arxiv.2511.15407,
  title  = {IPR-1: Interactive Physical Reasoner},
  author = {Mingyu Zhang and Lifeng Zhuo and Tianxi Tan and Guocan Xie and Xian Nie and Yan Li and Renjie Zhao and Zizhu He and Ziyu Wang and Jiting Cai and Yong-Lu Li},
  journal= {arXiv preprint arXiv:2511.15407},
  year   = {2026}
}

备注

Accepted by CVPR 2026. 13 pages of main text and 20 pages of appendices. Project page: https://mybearyzhang.github.io/ipr-1