UniTR:一种用于鸟瞰图表示的统一高效多模态Transformer
计算机视觉与模式识别
2023-08-16 v1
摘要
联合处理来自多个传感器的信息对于实现可靠自动驾驶系统的准确且鲁棒的感知至关重要。然而,当前的三维感知研究遵循特定模态的范式,导致额外的计算开销以及不同传感器数据之间低效的协作。在本文中,我们提出了一种用于室外三维感知的高效多模态骨干网络,名为UniTR,它以统一建模和共享参数处理多种模态。与以往工作不同,UniTR引入了一个模态无关的Transformer编码器来处理这些视角差异的传感器数据,用于并行的模态内表示学习和自动跨模态交互,而无需额外的融合步骤。更重要的是,为了充分利用这些互补的传感器类型,我们提出了一种新颖的多模态集成策略,同时考虑语义丰富的二维透视和几何感知的三维稀疏邻域关系。UniTR也是一个本质上任务无关的骨干网络,天然支持不同的三维感知任务。它在nuScenes基准上刷新了最先进的性能,在三维目标检测上实现了高+1.1 NDS,在BEV地图分割上实现了高12.0 mIoU,且推理延迟更低。代码将可在 https://github.com/Haiyang-W/UniTR 获取。
引用
@article{arxiv.2308.07732,
title = {UniTR: A Unified and Efficient Multi-Modal Transformer for Bird's-Eye-View Representation},
author = {Haiyang Wang and Hao Tang and Shaoshuai Shi and Aoxue Li and Zhenguo Li and Bernt Schiele and Liwei Wang},
journal= {arXiv preprint arXiv:2308.07732},
year = {2023}
}
备注
Accepted by ICCV2023