中文

RGB2LIDAR:面向大规模跨模态视觉定位的求解

计算机视觉与模式识别 2020-09-15 v1 多媒体

摘要

我们研究一个重要但很大程度上未被探索的大规模跨模态视觉定位问题,即通过匹配地面 RGB 图像与地理参考的航空 LIDAR 3D 点云(渲染为深度图像)。先前的工作在小型数据集上展示,难以扩展至大规模应用。为支持大规模评估,我们引入一个包含超过 55 万对(覆盖 143 km^2 区域)RGB 与航空 LIDAR 深度图像的新数据集。我们提出一种基于联合嵌入的新方法,有效结合来自两种模态的外观与语义线索,以处理剧烈的跨模态差异。在提出的数据集上的实验表明,我们的模型在从 14km^2 区域收集的 5 万位置对的大规模测试集上取得了中位排名为 5 的强结果。这代表了相较先前工作在性能与规模上的显著进步。我们以定性结果作结,以凸显该任务的挑战性及所提模型的益处。我们的工作为跨模态视觉定位的进一步研究提供了基础。

关键词

引用

@article{arxiv.2009.05695,
  title  = {RGB2LIDAR: Towards Solving Large-Scale Cross-Modal Visual Localization},
  author = {Niluthpol Chowdhury Mithun and Karan Sikka and Han-Pang Chiu and Supun Samarasekera and Rakesh Kumar},
  journal= {arXiv preprint arXiv:2009.05695},
  year   = {2020}
}

备注

ACM Multimedia 2020