中文

LVIC:通过提升视觉信息作为线索的多模态分割

计算机视觉与模式识别 2024-03-11 v1

摘要

多模态融合已被证明是自动驾驶 3D 感知的有效方法。然而,目前大多数用于 LiDAR 语义分割的多模态融合流程具有复杂的融合机制。点绘制(Point painting)是一种相当直接的方法,它将 LiDAR 点与视觉信息直接绑定。不幸的是,以前的点绘制类方法受限于相机和 LiDAR 之间的投影误差。在我们的实验中,我们发现这种投影误差是点绘制中的关键难题。因此,我们提出了一种深度感知的点绘制机制,显著提升了多模态融合效果。除此之外,我们更深入地研究了 LiDAR 进行语义分割所需的理想视觉特征。通过“提升视觉信息作为线索”(Lifting Visual Information as Cue),LVIC 在 nuScenes LiDAR 语义分割基准测试中排名第一。我们的实验展示了其鲁棒性和有效性。代码即将公开。

关键词

引用

@article{arxiv.2403.05159,
  title  = {LVIC: Multi-modality segmentation by Lifting Visual Info as Cue},
  author = {Zichao Dong and Bowen Pang and Xufeng Huang and Hang Ji and Xin Zhan and Junbo Chen},
  journal= {arXiv preprint arXiv:2403.05159},
  year   = {2024}
}