通过 In-Context Learning 实现机器人动作预测
机器人学
2025-03-18 v2 计算与语言
摘要
最近,大型语言模型 (LLM) 在语言领域取得了通过 in-context learning (ICL) 取得的显著成功。然而,在 LLM 中利用 ICL 能力直接预测机器人动作的工作仍受到忽视。在本文中,我们引入 RoboPrompt,一个框架,使即插即用的文本-only LLM 能够通过 ICL 直接预测机器人动作,而无需训练。我们的 approach 首先通过启发式方法从一个 episode 中识别关键帧,以捕捉重要时刻。接着,我们提取这些关键帧中的末端执行器动作以及估计的初始物体姿态,并将其转换为文本描述。最后,我们构建结构化模板,将这些文本描述以及任务指令形式化地构成 ICL 示例。这使得 LLM 能够在测试时直接预测机器人动作。通过大量实验与分析,RoboPrompt 在仿真和真实环境中相较于零样本和 ICL baseline 表现出更强的性能。我们的项目页面请访问 https://davidyyd.github.io/roboprompt。
引用
@article{arxiv.2410.12782,
title = {In-Context Learning Enables Robot Action Prediction in LLMs},
author = {Yida Yin and Zekai Wang and Yuvan Sharma and Dantong Niu and Trevor Darrell and Roei Herzig},
journal= {arXiv preprint arXiv:2410.12782},
year = {2025}
}
备注
Published in ICRA 2025