面向语言驱动机器人导航的层次化开放词汇 3D 场景图
机器人学
2024-10-01 v2 人工智能
计算与语言
计算机视觉与模式识别
机器学习
摘要
最近的开放词汇机器人映射方法通过预训练的视觉语言特征丰富稠密几何地图。虽然这些地图允许对特定语言概念进行点级显著性图预测,但大规模环境和超出对象层次的抽象查询仍然是一个巨大的挑战,最终限制了语言驱动的机器人导航。本文提出了 HOV-SG(Hierarchical Open-Vocabulary 3D Scene Graph),一种用于语言驱动机器人导航的层次化开放词汇 3D 场景图映射方法。利用开放词汇视觉基础模型,我们首先获得 3D 中的最先进的开放词汇分段级地图,随后构建由地面、房间和对象概念构成的 3D 场景图层次结构,每个概念都丰富了开放词汇特征。我们的 methods 能够表示多楼层建筑,并允许机器人通过跨楼 Voronoi 图进行遍历。HOV-SG 在三个不同数据集上进行评估,在对象、房间和地面层级上均在开放词汇语义准确性方面超越了之前的基线,同时相较于稠密开放词汇地图,表征大小降低了 75%。为证明 HOV-SG 的有效性和泛化能力,我们展示了在真实世界的多存储环境中成功进行的长程语言条件机器人导航。我们提供代码和试验视频数据,地址为 http://hovsg.github.io/。
引用
@article{arxiv.2403.17846,
title = {Hierarchical Open-Vocabulary 3D Scene Graphs for Language-Grounded Robot Navigation},
author = {Abdelrhman Werby and Chenguang Huang and Martin Büchner and Abhinav Valada and Wolfram Burgard},
journal= {arXiv preprint arXiv:2403.17846},
year = {2024}
}
备注
Code and video are available at http://hovsg.github.io/