中文

ERA:通过具身先验学习和在线强化学习将VLMs转化为具身智能体

人工智能 2025-10-15 v1

摘要

最近的具身AI进展凸显了视觉语言模型(VLMs)作为具身智能体的潜力,这些智能体能够在复杂环境中进行感知、推理和交互。然而,顶尖系统依赖大规模模型,部署成本高昂,而小型VLMs缺乏必要的知识和技能以成功。为弥合这一差距,我们提出了"具身推理智能体(Embodied Reasoning Agent, ERA)",一个集成先验知识学习和在线强化学习(RL)的两阶段框架。第一阶段"具身先验学习"从三类数据中提炼基础知识:(1)轨迹增强先验,通过更强模型生成的结构化推理丰富现有轨迹数据;(2)环境锚定先验,提供环境内知识和 grounding 监督;(3)外部知识先验,从脱离环境的数据集中传递通用知识。在第二阶段,我们开发了在线RL管道,基于这些先验进一步提升智能体性能。为克服代理RL的固有挑战,包括长期限值、稀疏奖励和训练不稳定,我们引入了三个关键设计:自总结(self-summarization)用于上下文管理、稠密奖励引导和分层策略优化。在高层规划(EB-ALFRED)和低层控制(EB-Manipulation)任务上的大规模实验表明,ERA-3B超越了基于提示的大型模型和以前的训练基线。具体而言,ERA-3B在EB-ALFRED上实现了相对于GPT-4o的8.4%的整体提升,在EB-Manipulation上实现了19.4%的提升,并在未见任务上表现出强大的泛化能力。总体而言,ERA为可扩展的具身智能提供了实用路径,为未来具身AI系统提供了方法论见解。

关键词

引用

@article{arxiv.2510.12693,
  title  = {ERA: Transforming VLMs into Embodied Agents via Embodied Prior Learning and Online Reinforcement Learning},
  author = {Hanyang Chen and Mark Zhao and Rui Yang and Qinwei Ma and Ke Yang and Jiarui Yao and Kangrui Wang and Hao Bai and Zhenhailong Wang and Rui Pan and Mengchao Zhang and Jose Barreiros and Aykut Onol and ChengXiang Zhai and Heng Ji and Manling Li and Huan Zhang and Tong Zhang},
  journal= {arXiv preprint arXiv:2510.12693},
  year   = {2025}
}