基于关系增强Transformer的文本到点云定位
计算机视觉与模式识别
2023-01-16 v1
摘要
基于少量自然语言指令自动定位位置对于未来机器人与人类沟通和协作至关重要。为了实现这一目标,我们专注于文本到点云的跨模态定位问题。给定一个文本查询,该任务旨在从城市规模的点云中识别出所描述的位置。该任务涉及两个挑战。1)在城市规模的点云中,相似的周围实例可能存在于多个位置。在巨大的点云中仅以实例作为引导来搜索每个位置,可能导致判别性信号较弱和错误的结果。2)在文本描述中,提示是分开提供的。在这种情况下,这些提示之间的关系没有被明确描述,导致学习关系的困难。为了克服这两个挑战,我们提出了一个统一的关系增强Transformer(RET)来提高点云和自然语言查询的表示判别力。所提出的RET的核心是一种新颖的关系增强自注意力(RSA)机制,它显式地为两种模态编码实例(提示)间的关系。此外,我们提出了一种细粒度的跨模态匹配方法,以在后续的实例-提示匹配阶段进一步细化位置预测。在KITTI360Pose数据集上的实验结果表明,我们的方法以较大优势超越了先前的最先进方法。
引用
@article{arxiv.2301.05372,
title = {Text to Point Cloud Localization with Relation-Enhanced Transformer},
author = {Guangzhi Wang and Hehe Fan and Mohan Kankanhalli},
journal= {arXiv preprint arXiv:2301.05372},
year = {2023}
}
备注
9 pages, 5 figures, accepted to AAAI-2023