指令跟随的目标表示:一种用于控制的自然语言半监督接口
机器人学
2025-01-09 v2 机器学习
摘要
我们的目标是让机器人遵循“把毛巾放在微波炉旁边”之类的自然语言指令。但获取大量标注数据(即包含以语言指令标注的任务演示的数据)是难以实现的。相比之下,获取响应图像目标的策略要容易得多,因为任何自主尝试或演示都可以在事后以其最终状态作为目标来标注。在这项工作中,我们提出了一种方法,仅使用少量语言数据,就能通过联合图像与目标条件策略接入语言。先前工作利用视觉-语言模型或联合训练语言-目标条件策略在这方面取得了进展,但迄今为止,这两种方法都未能在没有大量人工标注的情况下有效扩展到真实世界机器人任务。我们的方法通过学习来自标注数据的嵌入,将语言而非对齐到目标图像,而是对齐到指令所对应的起始与目标图像之间的期望变化,从而在真实世界中实现鲁棒性能。然后我们在该嵌入上训练策略:策略受益于所有未标注数据,但对齐的嵌入为语言提供了引导策略的接口。我们展示了跨不同场景中多种操作任务的指令跟随,以及对标注数据之外语言指令的泛化。我们方法的视频和代码可在我们的网站找到:https://rail-berkeley.github.io/grif/ 。
引用
@article{arxiv.2307.00117,
title = {Goal Representations for Instruction Following: A Semi-Supervised Language Interface to Control},
author = {Vivek Myers and Andre He and Kuan Fang and Homer Walke and Philippe Hansen-Estruch and Ching-An Cheng and Mihai Jalobeanu and Andrey Kolobov and Anca Dragan and Sergey Levine},
journal= {arXiv preprint arXiv:2307.00117},
year = {2025}
}
备注
15 pages, 5 figures