细节决定成败:图像到 LiDAR 表示学习的简单解决方案
计算机视觉与模式识别
2025-01-17 v1
摘要
LiDAR 是自动驾驶中重要的传感器,常与摄像头联合使用。通过利用这种摄像头-LiDAR 设置以及最近的图像表示学习进展,先前研究表明图像到 LiDAR 蒸馏具有巨大的潜力。这些先前的工作侧重于设计自己的损失函数,以有效地将 pre-trained 的 2D 图像表示蒸馏到 3D 模型中。然而,其他设计要素的探索 Surprisingly 未被充分考察。我们发现,fundamental design 元素——如 LiDAR 坐标系、根据现有输入接口进行量化,以及数据利用方式——比开发损失函数更为关键,这些要素在先前工作中被忽视。在本工作中,我们表明,这些设计的简单修复在 nuScenes 数据集上的 3D 语义分割中显著优于现有方法(提升 16%),在 KITTI 数据集上的 3D 目标检测中提升 13%。我们聚焦于沿着空间和时间轴上被忽视的设计选择。在空间方面,先前工作使用圆柱坐标和体素大小时,未考虑其与常用稀疏卷积层输入接口相关的副作用,导致 3D 模型中的空间量化误差。在时间方面,现有工作通过丢弃未同步的数据来规避繁琐的数据 curated 工作,限制了仅使用跨传感器时间同步的数据的范围。我们分析了这些影响,并为每个被忽视的方面提出了简单解决方案。
引用
@article{arxiv.2501.09485,
title = {The Devil is in the Details: Simple Remedies for Image-to-LiDAR Representation Learning},
author = {Wonjun Jo and Kwon Byung-Ki and Kim Ji-Yeon and Hawook Jeong and Kyungdon Joo and Tae-Hyun Oh},
journal= {arXiv preprint arXiv:2501.09485},
year = {2025}
}
备注
Accepted to ACCV2024