X-Align++:用于鸟瞰图分割的跨模态跨视角对齐
摘要
鸟瞰图(BEV)网格是道路组件(例如可行驶区域)感知的典型表示,常用于自动驾驶。大多数现有方法仅依赖相机在 BEV 空间中执行分割,这从根本上受限于缺乏可靠的深度信息。最新工作同时利用相机与 LiDAR 模态,但使用简单的基于拼接的机制次优地融合其特征。在本文中,我们通过增强单模态特征的对齐以辅助特征融合,以及增强相机透视视图(PV)与 BEV 表示之间的对齐来解决这些问题。我们提出 X-Align,一种用于 BEV 分割的新型端到端跨模态跨视角学习框架,由以下组件构成:(i) 一种新颖的跨模态特征对齐(X-FA)损失,(ii) 一个基于注意力的跨模态特征融合(X-FF)模块以隐式对齐多模态 BEV 特征,以及 (iii) 一个带有跨视角分割对齐(X-SA)损失的辅助 PV 分割分支以改进 PV 到 BEV 的转换。我们在两个常用基准数据集(即 nuScenes 与 KITTI-360)上评估所提方法。值得注意的是,X-Align 在 nuScenes 上以 3 个绝对 mIoU 点显著优于最先进水平。我们还提供了广泛的消融研究以证明各组件的有效性。
引用
@article{arxiv.2306.03810,
title = {X-Align++: cross-modal cross-view alignment for Bird's-eye-view segmentation},
author = {Shubhankar Borse and Senthil Yogamani and Marvin Klingner and Varun Ravi and Hong Cai and Abdulaziz Almuzairee and Fatih Porikli},
journal= {arXiv preprint arXiv:2306.03810},
year = {2023}
}
备注
Accepted for publication at Springer Machine Vision and Applications Journal. The Version of Record of this article is published in Machine Vision and Applications Journal, and is available online at https://doi.org/10.1007/s00138-023-01400-7. arXiv admin note: substantial text overlap with arXiv:2210.06778