中文

EfficientPENet: 基于轻量多模态融合的稀疏激光雷达实时深度补全

计算机视觉与模式识别 2026-04-22 v1

摘要

从稀疏激光雷达测量和对应的RGB图像进行深度补全是机器人系统中精确3D感知的前提。现有方法在标准基准上取得了高精度,但依赖于重型骨干架构,阻碍了在嵌入式硬件上的实时部署。我们提出了EfficientPENet,一个双分支深度补全网络,它用现代化的ConvNeXt骨干网络取代了传统的ResNet编码器,为深度流引入了稀疏不变卷积,并通过卷积空间传播网络(CSPN)细化预测。RGB分支利用ImageNet预训练的ConvNeXt模块,包含层归一化、7x7深度可分离卷积和随机深度正则化。两个分支的特征通过后期融合合并,并通过多尺度深度监督策略进行解码。我们进一步引入了一种位置感知的测试时增强方案,该方案在水平翻转时校正坐标张量,从而在推理时实现一致的误差减少。在KITTI深度补全基准上,EfficientPENet实现了631.94毫米的RMSE,参数量为36.24M,延迟为20.51毫秒,运行速度为48.76 FPS。与BP-Net相比,参数量减少了3.7倍,速度提升了23倍,同时保持了有竞争力的精度。这些结果确立了EfficientPENet作为在资源受限的边缘平台(如NVIDIA Jetson)上进行实时深度补全的实用解决方案。

关键词

引用

@article{arxiv.2604.18790,
  title  = {EfficientPENet: Real-Time Depth Completion from Sparse LiDAR via Lightweight Multi-Modal Fusion},
  author = {Johny J. Lopez and Md Meftahul Ferdaus and Mahdi Abdelguerfi and Anton Netchaev and Steven Sloan and Ken Pathak and Kendall N. Niles},
  journal= {arXiv preprint arXiv:2604.18790},
  year   = {2026}
}

备注

This work has been submitted to the IEEE for possible publication