基于相对位置感知的无实例文本到点云定位
计算机视觉与模式识别
2024-04-30 v1
摘要
文本到点云的跨模态定位是一项新兴的视觉-语言任务,对未来机器人-人类协作至关重要。该任务旨在根据少量自然语言指令,从城市规模的点云场景中定位一个位置。在本文中,我们解决了现有方法的两个关键局限性:1) 它们依赖真实实例作为输入;2) 它们忽略了潜在实例之间的相对位置。我们提出的模型遵循两阶段流程,包括一个用于文本-单元检索的粗粒度阶段和一个用于位置估计的细粒度阶段。在这两个阶段中,我们都引入了一个实例查询提取器,其中单元通过3D稀疏卷积U-Net进行编码以生成多尺度点云特征,并且一组查询迭代地关注这些特征以表示实例。在粗粒度阶段,设计了一个行列相对位置感知自注意力(RowColRPA)模块来捕获实例查询之间的空间关系。在细粒度阶段,开发了一个多模态相对位置感知交叉注意力(RPCA)模块,以融合文本和点云特征以及空间关系,从而改进细粒度位置估计。在KITTI360Pose数据集上的实验结果表明,我们的模型在不使用真实实例作为输入的情况下,取得了与最先进模型相竞争的性能。
引用
@article{arxiv.2404.17845,
title = {Instance-free Text to Point Cloud Localization with Relative Position Awareness},
author = {Lichao Wang and Zhihao Yuan and Jinke Ren and Shuguang Cui and Zhen Li},
journal= {arXiv preprint arXiv:2404.17845},
year = {2024}
}
备注
12 pages, 10 figures, conference