中文

用于实时地图视图语义分割的跨视角Transformer

计算机视觉与模式识别 2022-05-06 v1 人工智能

摘要

我们提出跨视角Transformer,一种基于注意力的高效模型,用于从多相机进行地图视图语义分割。我们的架构使用相机感知的跨视角注意力机制,隐式地学习从各个相机视角到规范地图视图表示的映射。每个相机使用依赖于其内参和外参标定的位置嵌入。这些嵌入使Transformer能够跨不同视角学习映射,而无需显式地以几何方式建模。该架构由每个视角的卷积图像编码器和跨视角Transformer层组成,以推断地图视图语义分割。我们的模型简单、易于并行化,且可实时运行。所提出的架构在nuScenes数据集上达到最先进水平,推理速度提升4倍。代码可在 https://github.com/bradyz/cross_view_transformers 获取。

关键词

引用

@article{arxiv.2205.02833,
  title  = {Cross-view Transformers for real-time Map-view Semantic Segmentation},
  author = {Brady Zhou and Philipp Krähenbühl},
  journal= {arXiv preprint arXiv:2205.02833},
  year   = {2022}
}

备注

CVPR 2022 Oral. Code at https://github.com/bradyz/cross_view_transformers