一种用于自动驾驶中图像引导深度补全的简洁高性能网络
计算机视觉与模式识别
2024-04-23 v2
摘要
深度补全是自动驾驶中的一项关键任务,旨在将稀疏深度图转换为稠密深度预测。由于 RGB 图像可能蕴含丰富的语义信息,通常将其融合以增强补全效果。图像引导的深度补全涉及三个关键挑战:1) 如何有效融合两种模态;2) 如何更好地恢复深度信息;3) 如何在实际自动驾驶中实现实时预测。为解决上述问题,我们提出了一种简洁而有效的网络,名为 CENet,以简单的结构实现高性能的深度补全。首先,我们使用快速引导模块融合两种传感器特征,利用从色彩空间提取的丰富辅助特征。与其他常用的复杂引导模块不同,我们的方法直观且低成本。此外,我们发现并分析了观测位置与未观测位置的优化不一致问题,并提出了解耦深度预测头来缓解该问题。所提出的解耦头能够以极少的额外推理时间更好地输出有效和无效位置的深度。基于双编码器单解码器的简单结构,CENet 能够在准确性和效率之间实现出色的平衡。在 KITTI 深度补全基准上,与 state-of-the-art 方法相比,CENet 取得了具有竞争力的性能和推理速度。为了验证我们方法的泛化能力,我们还在室内 NYUv2 数据集上进行了评估,CENet 依然取得了令人印象深刻的结果。本工作的代码将在 https://github.com/lmomoy/CHNet 上提供。
引用
@article{arxiv.2401.15902,
title = {A Concise but High-performing Network for Image Guided Depth Completion in Autonomous Driving},
author = {Moyun Liu and Bing Chen and Youping Chen and Jingming Xie and Lei Yao and Yang Zhang and Joey Tianyi Zhou},
journal= {arXiv preprint arXiv:2401.15902},
year = {2024}
}