中文

BUMBLE:用于建筑规模移动操作的统一视觉语言模型推理与行动

机器人学 2024-10-10 v1 人工智能

摘要

要实现建筑规模的操作,服务机器人必须通过导航到不同房间、访问不同楼层并与广泛且未被预见的日常物品进行交互来执行非常长期的移动操作任务。我们称这些任务为建筑规模移动操作。为应对这些固有的长期任务,我们引入了 BUMBLE,一个集成开放世界 RGBD 感知、粗至细运动技能谱系以及双层记忆的统一视觉语言模型(VLM)框架。我们的广泛评估(90+ 小时)表明,BUMBLE 在需要串联最多 12 个真实技能、每项试验持续约 15 分钟的长期建筑规模任务中优于多个基线方法。BUMBLE 在来自不同建筑、任务和场景布局的 70 项试验中,以 47.1% 的成功率表现良好。我们的可用性研究显示,我们的方法比当前最先进的移动操作方法高出 22% 的满意度。最后,我们展示了利用日益强大的基础模型进一步提升性能的潜力。了解更多信息,请参见 https://robin-lab.cs.utexas.edu/BUMBLE/。

关键词

引用

@article{arxiv.2410.06237,
  title  = {BUMBLE: Unifying Reasoning and Acting with Vision-Language Models for Building-wide Mobile Manipulation},
  author = {Rutav Shah and Albert Yu and Yifeng Zhu and Yuke Zhu and Roberto Martín-Martín},
  journal= {arXiv preprint arXiv:2410.06237},
  year   = {2024}
}

备注

7 Figures, 2 Tables, 11 Pages