中文

Text2Pos:文本到点云的跨模态定位

计算机视觉与模式识别 2022-04-06 v2 计算与语言 机器学习

摘要

基于自然语言与移动设备和家用电器的通信正日益普及,并有可能在未来成为与移动机器人通信的自然方式。为实现这一目标,我们研究跨模态文本到点云定位,这将允许我们指定例如车辆接客点或货物递送位置。特别地,我们提出 Text2Pos,一种跨模态定位模块,其学习以由粗到精的方式将文本描述与定位线索对齐。给定环境点云,Text2Pos 定位一个由对近邻环境的基于自然语言的描述所指定的位置。为训练 Text2Pos 并研究其性能,我们构建了 KITTI360Pose,这是基于最近推出的 KITTI360 数据集的该任务首个数据集。我们的实验表明,对于前 10 个检索位置,我们能在距查询位置 15m 距离内定位 65% 的文本查询。这是一个起点,我们希望它能激发未来朝向基于语言的导航的发展。

关键词

引用

@article{arxiv.2203.15125,
  title  = {Text2Pos: Text-to-Point-Cloud Cross-Modal Localization},
  author = {Manuel Kolmet and Qunjie Zhou and Aljosa Osep and Laura Leal-Taixe},
  journal= {arXiv preprint arXiv:2203.15125},
  year   = {2022}
}

备注

CVPR2022 Camera Ready Version