中文

面向光场-LiDAR语义分割的几何感知跨模态对齐

计算机视觉与模式识别 2026-04-16 v4 人工智能

摘要

语义分割是自动驾驶场景理解的基石,但在复杂条件(如遮挡)下仍面临重大挑战。光场和LiDAR模态提供互补的视觉和空间线索,有助于鲁棒感知;然而,其有效集成受到有限的视角多样性和固有模态差异的阻碍。为应对这些挑战,提出了首个整合光场数据和点云数据的多模态语义分割数据集。基于该数据集,我们提出了多模态光场-点云融合分割网络(Mlpfseg),结合特征补全和深度感知,同时对相机图像和LiDAR点云进行分割。特征补全模块通过点云特征图的差分重建来解决点云与图像像素之间的密度不匹配问题,增强了这些模态的融合。深度感知模块通过强化注意力分数以增强遮挡感知,从而改善对遮挡物体的分割。我们的方法相比仅图像分割提升了1.71平均交并比(mIoU),相比仅点云分割提升了2.38 mIoU,证明了其有效性。

关键词

引用

@article{arxiv.2510.06687,
  title  = {Geometry-Aware Cross Modal Alignment for Light Field-LiDAR Semantic Segmentation},
  author = {Jie Luo and Yuxuan Jiang and Xin Jin and Mingyu Liu and Yihui Fan},
  journal= {arXiv preprint arXiv:2510.06687},
  year   = {2026}
}