中文

面向长期语言引导的移动操作的动态开放词汇3D场景图

机器人学 2025-03-20 v6

摘要

使移动机器人在动态的真实世界环境中执行长期任务是一个艰巨的挑战,尤其是在环境因人机交互或机器人自身动作而频繁变化时。传统方法通常假设静态场景,这限制了它们在持续变化的现实世界中的适用性。为了克服这些限制,我们提出了DovSG,一个新颖的移动操作框架,它利用动态开放词汇3D场景图和语言引导的任务规划模块来执行长期任务。DovSG以RGB-D序列作为输入,并利用视觉语言模型(VLM)进行目标检测,以获得高层次的目标语义特征。基于分割出的目标,生成一个结构化的3D场景图用于低层次的空间关系。此外,一种高效的局部更新场景图机制,使得机器人在交互过程中无需完全重建场景即可动态调整图的部分。该机制在动态环境中尤其有价值,使机器人能够持续适应场景变化,并有效支持长期任务的执行。我们在具有不同程度人工修改的真实世界环境中验证了我们的系统,证明了其在长期任务中的有效性和优越性能。我们的项目页面位于:https://bjhyzj.github.io/dovsg-web。

关键词

引用

@article{arxiv.2410.11989,
  title  = {Dynamic Open-Vocabulary 3D Scene Graphs for Long-term Language-Guided Mobile Manipulation},
  author = {Zhijie Yan and Shufei Li and Zuoxu Wang and Lixiu Wu and Han Wang and Jun Zhu and Lijiang Chen and Jihong Liu},
  journal= {arXiv preprint arXiv:2410.11989},
  year   = {2025}
}

备注

Accepted by IEEE Robotics and Automation Letters (RA-L), 2025