中文

GRAPPA:通过在线智能体指导通用化和适应机器人策略

机器人学 2025-04-09 v3 人工智能

摘要

行为克隆和强化学习等机器人学习方法在特定环境中从人类演示中合成机器人技能方面显示出巨大潜力。然而,这些方法通常需要任务特定的演示或设计复杂的仿真环境,从而限制了针对未知现实环境开发通用且稳健策略的能力。近期采用基础模型进行机器人学习(如大语言模型、视觉语言模型)的进展显示出巨大潜力,使系统能够从大规模互联网数据中理解世界语义。然而,要利用这种知识使机器人系统理解世界底层动态、跨不同任务泛化策略、并适应新环境仍是一个待解决的挑战。为缓解这些限制,我们提出了一种用于机器人自我指导和自我改进的智能体框架,包括一组角色专化的对话智能体,如高级顾问、 grounding 代理、监控代理和机器人代理。我们的框架迭代地将基础机器人策略 grounding 到环境中相关对象,并利用视觉运动线索将策略的动作分布在线地偏移到更理想的状态,同时对给定机器人硬件平台的主观配置保持不知觉。我们展示了该方法能够在仿真和真实世界实验中有效指导操作策略,以显著提高成功率,无需额外的人类演示或广泛探索。代码和视频已提供: https://agenticrobots.github.io

关键词

引用

@article{arxiv.2410.06473,
  title  = {GRAPPA: Generalizing and Adapting Robot Policies via Online Agentic Guidance},
  author = {Arthur Bucker and Pablo Ortega-Kral and Jonathan Francis and Jean Oh},
  journal= {arXiv preprint arXiv:2410.06473},
  year   = {2025}
}

备注

21 pages, 12 figures, 4 tables