LIP-Loc:用于跨模态定位的 LiDAR 图像预训练
机器人学
2023-12-29 v1 计算机视觉与模式识别
摘要
LiDAR 地图中的全局视觉定位对于自动驾驶应用至关重要,但由于跨越跨模态异构性差距的挑战性问题,该领域仍未得到充分探索。流行的多模态学习方法对比语言 - 图像预训练(CLIP)通过将批构建技术应用于文本和图像的多模态领域,普及了对称对比损失。我们将此方法应用于 2D 图像和 3D LiDAR 点领域,以执行跨模态定位任务。我们的方法如下:构建一批 N 个(图像,LiDAR)对,通过联合训练图像编码器和 LiDAR 编码器来学习多模态嵌入空间,从而预测批内 N X N 种可能配对中的正确匹配。以此方式,最大化 N 个正配对的余弦相似度,同时最小化剩余负配对的相似度。最后,在获得的相似度分数上优化对称交叉熵损失。据我们所知,这是首次将批损失方法应用于图像和 LiDAR 数据的跨模态设置,并展示了视觉定位设置中的零样本迁移能力。我们在标准的自动驾驶数据集(如 KITTI 和 KITTI-360 数据集)上进行了广泛分析。我们的方法仅使用透视图像,在 KITTI-360 数据集上的 recall@1 准确率比最先进方法高出 22.4%,而最先进方法利用的是信息量更大的鱼眼图像。此外,这种卓越的性能是在不依赖复杂架构的情况下实现的。 moreover,我们展示了模型的零样本能力,甚至无需在其上训练即可超越 SOTA 8%。此外,我们建立了 KITTI 数据集上跨模态定位的首个基准。
引用
@article{arxiv.2312.16648,
title = {LIP-Loc: LiDAR Image Pretraining for Cross-Modal Localization},
author = {Sai Shubodh Puligilla and Mohammad Omama and Husain Zaidi and Udit Singh Parihar and Madhava Krishna},
journal= {arXiv preprint arXiv:2312.16648},
year = {2023}
}
备注
To be presented at WACV-W 2024. Project page: https://shubodhs.ai/liploc