中文

基于几何引导核Transformer的高效鲁棒2D到BEV表征学习

计算机视觉与模式识别 2022-06-10 v1

摘要

从环视相机学习鸟瞰图(BEV)表征对自动驾驶至关重要。本工作中,我们提出一种新颖的 2D 到 BEV 表征学习机制——几何引导核 Transformer(GKT)。GKT 利用几何先验引导 Transformer 聚焦于判别性区域,并展开核特征以生成 BEV 表征。为快速推理,我们进一步引入查找表(LUT)索引方法,在运行时摆脱相机标定参数。GKT 在 3090 GPU 上可达 72.372.3 FPS、在 2080ti GPU 上可达 45.645.6 FPS,且对相机偏差与预定义 BEV 高度鲁棒。GKT 取得了最先进的实时分割结果,即在 nuScenes 验证集上 38.0 mIoU(100m×\times100m 感知范围、0.5m 分辨率)。鉴于其效率、有效性与鲁棒性,GKT 在自动驾驶场景尤其是实时运行系统中具有重要实用价值。代码与模型将发布于 \url{https://github.com/hustvl/GKT}。

关键词

引用

@article{arxiv.2206.04584,
  title  = {Efficient and Robust 2D-to-BEV Representation Learning via Geometry-guided Kernel Transformer},
  author = {Shaoyu Chen and Tianheng Cheng and Xinggang Wang and Wenming Meng and Qian Zhang and Wenyu Liu},
  journal= {arXiv preprint arXiv:2206.04584},
  year   = {2022}
}

备注

Tech report. Work in progress