超越裸查询:基于三维场景图的开放词汇目标定位
计算机视觉与模式识别
2025-05-07 v4 人工智能
摘要
定位自然语言描述的目标对自主智能体来说是一个重大挑战。现有的基于CLIP的开放词汇方法能够成功执行简单(裸)查询的三维目标定位,但无法处理需要理解目标关系的模糊描述。为了解决这个问题,我们提出了一种名为BBQ(超越裸查询)的模块化方法,该方法构建了具有度量空间边和语义空间边的三维场景图表示,并通过我们的演绎场景推理算法利用大型语言模型作为人机接口。BBQ采用鲁棒的DINO驱动的关联来构建三维以目标为中心的语义地图,并采用先进的射线投射算法结合二维视觉语言模型来将它们描述为图节点。在Replica和ScanNet数据集上,我们证明了BBQ在开放词汇三维语义分割方面与其他零样本方法相比处于领先地位。此外,我们展示了利用空间关系对于包含多个相同语义类别实体的场景尤其有效。在具有挑战性的Sr3D+、Nr3D和ScanRefer基准测试中,我们的演绎方法相比其他最先进的方法,在通过复杂查询实现目标定位方面表现出显著改进。我们的设计选择和软件实现的结合,使得在机器人车载计算机上的实验数据处理速度显著提高。这一有前景的性能使得我们的方法能够应用于智能机器人项目。我们已将代码公开发布在https://linukc.github.io/BeyondBareQueries/。
引用
@article{arxiv.2406.07113,
title = {Beyond Bare Queries: Open-Vocabulary Object Grounding with 3D Scene Graph},
author = {Sergey Linok and Tatiana Zemskova and Svetlana Ladanova and Roman Titkov and Dmitry Yudin and Maxim Monastyrny and Aleksei Valenkov},
journal= {arXiv preprint arXiv:2406.07113},
year = {2025}
}
备注
6 pages, 6 figures, 5 tables