SPOC:在仿真中模仿最短路径实现真实世界中的有效导航与操作
机器人学
2024-08-09 v2 人工智能
计算机视觉与模式识别
摘要
具有密集奖励的强化学习(RL)和使用人类生成轨迹的模仿学习(IL)是训练现代具身智能体最广泛使用的方法。RL需要大量的奖励塑形和辅助损失,并且对于长程任务通常过于缓慢且效果不佳。虽然有人类监督的IL是有效的,但大规模收集人类轨迹极其昂贵。在这项工作中,我们展示了在仿真中模仿最短路径规划器能够产生这样的智能体:给定语言指令,仅使用RGB传感器(无深度图或GPS坐标),即可在仿真和真实世界中熟练地进行导航、探索和操作物体。这一令人惊讶的结果得益于我们的端到端、基于Transformer的SPOC架构、强大的视觉编码器与广泛的图像增强相结合,以及我们训练数据的庞大规模和多样性:在约200,000个程序生成的房屋中收集的数百万帧最短路径专家轨迹,这些房屋包含40,000个独特的3D资产。我们的模型、数据、训练代码以及新提出的10任务基准测试套件CHORES可在https://spoc-robot.github.io获取。
引用
@article{arxiv.2312.02976,
title = {SPOC: Imitating Shortest Paths in Simulation Enables Effective Navigation and Manipulation in the Real World},
author = {Kiana Ehsani and Tanmay Gupta and Rose Hendrix and Jordi Salvador and Luca Weihs and Kuo-Hao Zeng and Kunal Pratap Singh and Yejin Kim and Winson Han and Alvaro Herrasti and Ranjay Krishna and Dustin Schwenk and Eli VanderBilt and Aniruddha Kembhavi},
journal= {arXiv preprint arXiv:2312.02976},
year = {2024}
}
备注
First six authors contributed equally. Project page: https://spoc-robot.github.io/