中文

MinkLoc++:用于地点识别的激光雷达与单目图像融合

计算机视觉与模式识别 2021-04-15 v2

摘要

我们基于一对传感器读数——来自 LiDAR 的点云和来自 RGB 相机的图像——引入了一种判别性多模态描述子。我们的描述子名为 MinkLoc++,可用于机器人或自动驾驶应用中的地点识别、重定位与回环检测目的。我们采用后期融合方法,每种模态被分别处理并在处理流水线的最后部分融合。所提方法在标准地点识别基准上取得了最先进的性能。我们还发现了训练多模态描述子时的主导模态问题。该问题表现为网络聚焦于对训练数据过拟合更严重的模态。这在训练期间拉低了损失,却导致在评估集上性能次优。在本工作中,我们描述了当使用深度度量学习方法训练多模态神经网络时,如何检测并缓解此类风险。我们的代码已在项目网站公开:https://github.com/jac99/MinkLocMultimodal。

关键词

引用

@article{arxiv.2104.05327,
  title  = {MinkLoc++: Lidar and Monocular Image Fusion for Place Recognition},
  author = {Jacek Komorowski and Monika Wysoczanska and Tomasz Trzcinski},
  journal= {arXiv preprint arXiv:2104.05327},
  year   = {2021}
}