RoboInspector: 揭示 LLM 启用机器人操作中策略代码不可靠性
机器人学
2025-09-01 v1 人工智能
摘要
大型语言模型(LLMs)在推理和代码生成方面展现出惊人的能力,使机器人操作仅需一个指令即可启动。LLM 通过生成控制机器人所需的策略代码来完成各种任务。尽管 LLMs 前进了许多,但实现可靠的策略代码生成仍然是一个重大挑战,因为现实任务的要求多样且用户指令的内在复杂性大。实际中,不同用户可能为完成相同任务驱动机器人提供不同的指令,这可能导致策略代码生成的不可靠。为弥合这一差距,我们设计了 RoboInspector,这是一个揭示和刻画 LLM 启用机器人操作策略代码不可靠性的管道,从两个视角进行:操作任务的复杂性和指令的细粒度。我们在两个主要框架中对 168 种不同的任务、指令和 LLM 的组合进行了全面实验。RoboInspector 识别出四种主要的不可靠行为导致操作失败。我们对这些行为及其根本原因进行了详细刻画,为实践开发提供了见解以减少不可靠性。此外,我们引入了一种由失败策略代码反馈引导的细化方法,通过提升 LLM 启用机器人操作策略代码的可靠性,实验在模拟和真实环境中均得到评估。
关键词
引用
@article{arxiv.2508.21378,
title = {RoboInspector: Unveiling the Unreliability of Policy Code for LLM-enabled Robotic Manipulation},
author = {Chenduo Ying and Linkang Du and Peng Cheng and Yuanchao Shu},
journal= {arXiv preprint arXiv:2508.21378},
year = {2025}
}