中文

CoBEVT:基于稀疏Transformer的协同鸟瞰图语义分割

计算机视觉与模式识别 2022-09-27 v2

摘要

鸟瞰图(BEV)语义分割在自动驾驶的空间感知中起着至关重要的作用。尽管近期文献在BEV地图理解方面取得了显著进展,但它们都基于单智能体相机系统。这些方案在复杂交通场景中有时难以处理遮挡或检测远处物体。车对车(V2V)通信技术使自动驾驶车辆能够共享感知信息,与单智能体系统相比显著提升了感知性能与范围。本文中,我们提出CoBEVT,首个可协同生成BEV地图预测的通用的多智能体多相机感知框架。为了在底层Transformer架构中高效融合来自多视角和多智能体数据的相机特征,我们设计了融合轴向注意力模块(FAX),其捕获跨视角和跨智能体的稀疏局部与全局空间交互。在V2V感知数据集OPV2V上的大量实验表明,CoBEVT在协同BEV语义分割上达到了最先进的性能。此外,CoBEVT被证明可泛化至其他任务,包括1)单智能体多相机的BEV分割和2)多智能体LiDAR系统的3D物体检测,以实时推理速度达到最先进性能。代码可见于https://github.com/DerrickXuNu/CoBEVT。

关键词

引用

@article{arxiv.2207.02202,
  title  = {CoBEVT: Cooperative Bird's Eye View Semantic Segmentation with Sparse Transformers},
  author = {Runsheng Xu and Zhengzhong Tu and Hao Xiang and Wei Shao and Bolei Zhou and Jiaqi Ma},
  journal= {arXiv preprint arXiv:2207.02202},
  year   = {2022}
}

备注

CoRL 2022; code: https://github.com/DerrickXuNu/CoBEVT