大语言模型能否生成类人寻路指令?迈向平台无关的具身指令合成
机器人学
2024-04-03 v3 人工智能
摘要
我们提出了一种新颖的方法,用于为具身机器人智能体自动合成“寻路指令”。与先前严重依赖专为特定仿真平台设计的人工标注数据集的方法相比,我们的算法利用上下文学习,仅使用少量参考样本即可调节大语言模型(LLM)生成指令。通过基于LLM的视觉问答策略,我们收集有关环境的详细信息,供LLM用于指令合成。我们在包括Matterport3D、AI Habitat和ThreeDWorld在内的多个仿真平台上实现了我们的方法,从而展示了其平台无关的特性。我们通过用户研究对我们的方法进行了主观评估,观察到83.3%的用户认为合成的指令准确捕捉了环境的细节,并展现出与人类生成指令相似的特征。此外,我们使用生成的指令在REVERIE数据集上进行了多种方法的零样本导航,观察到在标准成功指标上与基线有非常接近的相关性(成功率变化小于1%),量化了生成指令在替代人工标注数据方面的可行性。最后,我们讨论了我们的方法在实现具身导航策略的通用化评估中的适用性。据我们所知,这是首个由LLM驱动的、能够以平台无关的方式生成“类人”指令的方法,且无需训练。
引用
@article{arxiv.2403.11487,
title = {Can LLMs Generate Human-Like Wayfinding Instructions? Towards Platform-Agnostic Embodied Instruction Synthesis},
author = {Vishnu Sashank Dorbala and Sanjoy Chowdhury and Dinesh Manocha},
journal= {arXiv preprint arXiv:2403.11487},
year = {2024}
}
备注
14 Pages