中文

MoDem-V2:面向真实世界机器人操作的视觉-运动世界模型

机器人学 2024-05-14 v2 人工智能 计算机视觉与模式识别 机器学习

摘要

期望在无仪器真实世界环境中运行的机器人系统必须经由机载传感直接感知世界。基于视觉的学习系统旨在基于原始像素建立对世界的隐式理解,从而消除对环境仪表化的需求,但仅从稀疏视觉奖励信号导航富含接触的高维搜索空间显著加剧了探索难题。此类系统的适用性因此通常受限为模拟或重度工程化环境,因为缺乏显式状态估计与稠密奖励引导的真实世界智能体探索可能导致不安全行为与灾难性安全故障。在本研究中,我们隔离这些局限背后的根本原因,以开发名为MoDem-V2的系统,能够直接在无仪器真实世界中学习富含接触的操作。基于模型基强化学习(MBRL)、演示引导与有效探索的最新算法进展,MoDem-V2可直接在真实世界中习得富含接触的灵巧操作技能。我们确定了在模型学习中利用演示同时尊重真实世界安全考量——探索居中、代理交接与行动者-评论者集成——的关键要素。我们在模拟与真实世界的四个复杂视觉-运动操作问题中实证展示了这些要素的贡献。据我们所知,我们的工作呈现了首个直接在真实世界中训练的演示增强视觉MBRL成功系统。访问 https://sites.google.com/view/modem-v2 观看视频与更多细节。

关键词

引用

@article{arxiv.2309.14236,
  title  = {MoDem-V2: Visuo-Motor World Models for Real-World Robot Manipulation},
  author = {Patrick Lancaster and Nicklas Hansen and Aravind Rajeswaran and Vikash Kumar},
  journal= {arXiv preprint arXiv:2309.14236},
  year   = {2024}
}

备注

10 pages, 8 figures