RT-H: 使用语言的动作层次结构
机器人学
2024-06-04 v2 人工智能
摘要
语言提供了一种将复杂概念分解为易于理解的片段的方法。最近在机器人模仿学习的工作中,使用了语言条件策略,该策略在给定视觉观察和以语言指定的高级任务的情况下预测动作。这些方法利用自然语言的结构在多任务数据集中的语义相似任务之间共享数据(例如,“拿起可乐罐”和“拿起苹果”)。然而,随着任务在语义上变得更加多样化(例如,“拿起可乐罐”和“倒杯子”),在任务之间共享数据变得更加困难,因此学习将高级任务映射到动作需要更多的演示数据。为了在任务和动作之间建立桥梁,我们的见解是教机器人动作的语言,用更细粒度的短语描述低级运动,如“向前移动手臂”。将这些语言运动预测作为任务和动作之间的中间步骤,迫使策略学习看似不相关的任务之间低级运动的共享结构。此外,以语言运动为条件的策略在执行过程中可以很容易地通过人类指定的语言运动进行纠正。这为灵活策略提供了一种新范式,可以从人类的语言干预中学习。我们的方法 RT-H 使用语言运动构建动作层次结构:它首先学习预测语言运动,并以此为条件结合高级任务,在所有阶段使用视觉上下文来预测动作。我们表明,RT-H 利用这种语言-动作层次结构,通过有效利用多任务数据集来学习更稳健和灵活的策略。我们表明,这些策略不仅允许对语言干预做出响应,而且可以从这些干预中学习,并优于从遥操作干预中学习的方法。我们的网站和视频可在 https://rt-hierarchy.github.io 找到。
引用
@article{arxiv.2403.01823,
title = {RT-H: Action Hierarchies Using Language},
author = {Suneel Belkhale and Tianli Ding and Ted Xiao and Pierre Sermanet and Quon Vuong and Jonathan Tompson and Yevgen Chebotar and Debidatta Dwibedi and Dorsa Sadigh},
journal= {arXiv preprint arXiv:2403.01823},
year = {2024}
}