中文

RIG:端到端通用策略中推理与想象的协同

人工智能 2025-04-02 v1 计算与语言 计算机视觉与模式识别 机器学习

摘要

在行动前进行推理并想象潜在结果(即世界模型)对于在复杂开放世界环境中运行的具身智能体至关重要。然而,先前的工作要么在端到端智能体中仅整合其中一种能力,要么将多个专用模型集成到智能体系统中,这限制了策略的学习效率和泛化能力。因此,本文首次尝试在端到端通用策略中协同推理与想象,称为RIG。为了以端到端方式训练RIG,我们构建了一个数据流水线,逐步整合并丰富从现有智能体收集的轨迹中的想象和推理内容。推理与下一图像生成的联合学习显式地建模了推理、动作和环境动力学之间的内在关联,因此与先前工作相比,展现出超过17×17\times的样本效率提升和泛化能力。在推理过程中,RIG首先推理下一个动作,产生潜在动作,然后预测动作结果,这为智能体提供了在采取真实动作前基于想象进行审查和自我纠正的机会。实验结果表明,推理与想象的协同不仅提高了通用策略的鲁棒性、泛化能力和可互操作性,还实现了测试时扩展以增强整体性能。

关键词

引用

@article{arxiv.2503.24388,
  title  = {RIG: Synergizing Reasoning and Imagination in End-to-End Generalist Policy},
  author = {Zhonghan Zhao and Wenwei Zhang and Haian Huang and Kuikun Liu and Jianfei Gao and Gaoang Wang and Kai Chen},
  journal= {arXiv preprint arXiv:2503.24388},
  year   = {2025}
}