X-Align:用于鸟瞰图分割的跨模态跨视图对齐
计算机视觉与模式识别
2022-11-01 v2
摘要
鸟瞰图(BEV)网格是自动驾驶中道路组件(如可行驶区域)感知的常用表示。大多数现有方法仅依赖相机在 BEV 空间中进行分割,这从根本上受限于缺乏可靠的深度信息。最新工作同时利用相机和 LiDAR 模态,但使用简单的基于拼接的机制次优地融合其特征。本文中,我们通过增强单模态特征的对齐以辅助特征融合,以及增强相机透视视图(PV)与 BEV 表示之间的对齐来解决这些问题。我们提出 X-Align,一种用于 BEV 分割的新型端到端跨模态跨视图学习框架,由以下组件构成:(i) 一种新颖的跨模态特征对齐(X-FA)损失,(ii) 基于注意力的跨模态特征融合(X-FF)模块以隐式对齐多模态 BEV 特征,以及 (iii) 带有跨视图分割对齐(X-SA)损失的辅助 PV 分割分支以改进 PV 到 BEV 的转换。我们在两个常用基准数据集 nuScenes 和 KITTI-360 上评估了所提方法。值得注意的是,X-Align 在 nuScenes 上以 3 个绝对 mIoU 点显著优于当前最优方法。我们还提供了广泛的消融实验以证明各组件的有效性。
引用
@article{arxiv.2210.06778,
title = {X-Align: Cross-Modal Cross-View Alignment for Bird's-Eye-View Segmentation},
author = {Shubhankar Borse and Marvin Klingner and Varun Ravi Kumar and Hong Cai and Abdulaziz Almuzairee and Senthil Yogamani and Fatih Porikli},
journal= {arXiv preprint arXiv:2210.06778},
year = {2022}
}
备注
Accepted to WACV 2023