中文

基于 LLM 常识推理的人在回路机器人动作重规划方法

机器人学 2025-07-29 v1

摘要

为了促进机器人的更广泛普及,需要为非专家用户提供可及的编程工具。观察学习通过动手演示实现了直观的人类技能迁移,但仅依赖视觉输入在可扩展性和故障缓解方面效率较低,尤其是在仅基于单次演示时。本文提出了一种人在回路方法,通过向大型语言模型(LLM)输入自然语言来增强基于单段 RGB 视频自动生成的机器人执行计划。通过纳入用户指定的目标或关键任务方面,并利用 LLM 的常识推理,系统能够调整基于视觉的计划以防止潜在故障,并根据接收到的指令进行自适应。实验表明,该框架在纠正视觉衍生错误和无需额外演示即可调整计划方面具有直观性和有效性。此外,交互式计划细化与幻觉纠正提升了系统的鲁棒性。

关键词

引用

@article{arxiv.2507.20870,
  title  = {A Human-in-the-loop Approach to Robot Action Replanning through LLM Common-Sense Reasoning},
  author = {Elena Merlo and Marta Lagomarsino and Arash Ajoudani},
  journal= {arXiv preprint arXiv:2507.20870},
  year   = {2025}
}