释放 HyDRa:混合融合、深度一致性与雷达用于统一 3D 感知
计算机视觉与模式识别
2025-03-27 v4
摘要
近年来,面向自动驾驶的低成本、以视觉为中心的 3D 感知系统取得了显著进展,缩小了与昂贵的基于 LiDAR 的方法之间的差距。成为完全可靠替代方案的主要挑战在于鲁棒的深度预测能力,因为基于摄像头的系统在长距离检测以及恶劣光照和天气条件下存在困难。在本工作中,我们提出了 HyDRa,一种面向多样化 3D 感知任务的新型相机-雷达融合架构。基于稠密 BEV (Bird's Eye View) 架构的原理,HyDRa 引入了一种混合融合方法,在两个不同的表示空间中结合了互补的相机和雷达特征的优势。我们的 Height Association Transformer 模块在透视图中利用雷达特征,以产生更鲁棒、更准确的深度预测。在 BEV 中,我们通过雷达加权的深度一致性来细化初始的稀疏表示。HyDRa 在公开的 nuScenes 数据集上实现了 64.2 NDS (+1.8) 和 58.4 AMOTA (+1.5) 的相机-雷达融合新 SOTA。此外,我们新的语义丰富且空间准确的 BEV 特征可以直接转换为强大的占据表示,在 Occ3D 基准上以 3.7 mIoU 的显著优势击败了所有先前基于摄像头的方法。代码和模型可在 https://github.com/phi-wol/hydra 获取。
引用
@article{arxiv.2403.07746,
title = {Unleashing HyDRa: Hybrid Fusion, Depth Consistency and Radar for Unified 3D Perception},
author = {Philipp Wolters and Johannes Gilg and Torben Teepe and Fabian Herzog and Anouar Laouichi and Martin Hofmann and Gerhard Rigoll},
journal= {arXiv preprint arXiv:2403.07746},
year = {2025}
}
备注
Accepted to ICRA 2025