通过语言纠正为机器人操作蒸馏与检索可泛化知识
机器人学
2024-03-22 v2 人工智能
机器学习
摘要
当今的机器人策略在面临泛化到新环境的挑战时表现出较差的性能。人类纠正性反馈是实现此类泛化的一种关键引导形式。然而,适应并学习在线人类纠正是非平凡之举:机器人不仅需随时间记住人类反馈以在新设置中检索正确信息并降低干预率,还需能够响应可为关于高层人类偏好的任意纠正到低层技能参数调整的反馈。在本工作中,我们提出基于大语言模型(LLM)的在线纠正蒸馏与检索(DROC)系统,其可响应任意形式的语言反馈,从纠正中蒸馏可泛化知识,并基于文本与视觉相似性检索相关过往经验以提升在新环境中的性能。DROC 能够响应一系列在线语言纠正,这些纠正解决了高层任务计划与低层技能基元中的失败。我们证明 DROC 有效地从一系列在线纠正中在知识库中蒸馏相关信息,并在具有新任务或物体实例的设置中检索该知识。DROC 优于其他通过 LLM 直接生成机器人代码的技术,仅使用第一轮所需纠正总数的一半,并在两次迭代后需要极少乃至无需纠正。我们在 https://sites.google.com/stanford.edu/droc 展示了进一步结果、视频、提示与代码。
引用
@article{arxiv.2311.10678,
title = {Distilling and Retrieving Generalizable Knowledge for Robot Manipulation via Language Corrections},
author = {Lihan Zha and Yuchen Cui and Li-Heng Lin and Minae Kwon and Montserrat Gonzalez Arenas and Andy Zeng and Fei Xia and Dorsa Sadigh},
journal= {arXiv preprint arXiv:2311.10678},
year = {2024}
}
备注
8 pages, 4 figures, videos and code links on website https://sites.google.com/stanford.edu/droc