用于鸟瞰图统一道路布局估计与三维目标检测的双循环跨视角 Transformer 网络
计算机视觉与模式识别
2022-09-20 v1
摘要
鸟瞰图(BEV)表示允许对自动驾驶的多个任务(包括道路布局估计和 3D 目标检测)进行鲁棒学习。然而,当代用于统一道路布局估计和 3D 目标检测的方法很少处理训练数据集的类别不平衡以及多类学习,以减少所需网络的总数。为克服这些局限,我们受 transformer 架构和 CycleGAN 学习框架启发,提出了一个用于道路布局估计和 3D 目标检测的统一模型。所提模型利用 focal loss 和提出的双循环损失来处理由数据集类别不平衡引起的性能退化。此外,我们建立了广泛的学习场景以研究多类学习在不同情况下对道路布局估计的影响。为验证所提模型和学习方案的有效性,我们进行了彻底的消融研究和对比研究。实验结果证明了我们模型的有效性;我们在道路布局估计和 3D 目标检测任务上均取得了最先进的性能。
引用
@article{arxiv.2209.08844,
title = {A Dual-Cycled Cross-View Transformer Network for Unified Road Layout Estimation and 3D Object Detection in the Bird's-Eye-View},
author = {Curie Kim and Ue-Hwan Kim},
journal= {arXiv preprint arXiv:2209.08844},
year = {2022}
}