中文

LERa:基于视觉反馈的指令跟随重规划

机器人学 2025-10-07 v2

摘要

大型语言模型 (LLM) 正在机器人任务规划中日益广泛地使用,但其依赖文本输入的特性限制了其对实际变化和故障的适应性。为解决这些挑战,我们提出了 LERa - Look, Explain, Replan - 一种基于视觉语言模型的重规划方法,利用视觉反馈。与现有方法不同,LERa 只需原始 RGB 图像、自然语言指令、初始任务计划和故障检测,无需额外信息(如目标检测或预定义条件),这些信息在特定情境下可能不可得。重规划过程包括三个步骤:(i) Look - LERa 生成场景描述并识别错误;(ii) Explain - 它提供纠正性指导;(iii) Replan - 它相应修改计划。LERa 可适用于各种机器人体系结构,能够处理来自动态场景变化和任务执行故障的错误。我们在新引入的 ALFRED-ChaOS 和 VirtualHome-ChaOS 数据集上评估了 LERa,在动态环境下的准确率比基线提高了 40%。在具备预设任务失败概率的桌面操作任务中,LERa 将成功率提高最高可达 67%。进一步的实验,包括与桌面操作机械臂机器人的实际测试,确认了 LERa 在重规划方面的有效性。我们展示了 LERa 是一种稳健且可适应的解决方案,可用于机器人任务执行中的错误感知。项目页面已公开 https://lera-robo.github.io。

关键词

引用

@article{arxiv.2507.05135,
  title  = {LERa: Replanning with Visual Feedback in Instruction Following},
  author = {Svyatoslav Pchelintsev and Maxim Patratskiy and Anatoly Onishchenko and Alexandr Korchemnyi and Aleksandr Medvedev and Uliana Vinogradova and Ilya Galuzinsky and Aleksey Postnikov and Alexey K. Kovalev and Aleksandr I. Panov},
  journal= {arXiv preprint arXiv:2507.05135},
  year   = {2025}
}

备注

Accepted to IROS 2025