基于几何引导核Transformer的高效鲁棒2D到BEV表征学习
计算机视觉与模式识别
2022-06-10 v1
摘要
从环视相机学习鸟瞰图(BEV)表征对自动驾驶至关重要。本工作中,我们提出一种新颖的 2D 到 BEV 表征学习机制——几何引导核 Transformer(GKT)。GKT 利用几何先验引导 Transformer 聚焦于判别性区域,并展开核特征以生成 BEV 表征。为快速推理,我们进一步引入查找表(LUT)索引方法,在运行时摆脱相机标定参数。GKT 在 3090 GPU 上可达 FPS、在 2080ti GPU 上可达 FPS,且对相机偏差与预定义 BEV 高度鲁棒。GKT 取得了最先进的实时分割结果,即在 nuScenes 验证集上 38.0 mIoU(100m100m 感知范围、0.5m 分辨率)。鉴于其效率、有效性与鲁棒性,GKT 在自动驾驶场景尤其是实时运行系统中具有重要实用价值。代码与模型将发布于 \url{https://github.com/hustvl/GKT}。
引用
@article{arxiv.2206.04584,
title = {Efficient and Robust 2D-to-BEV Representation Learning via Geometry-guided Kernel Transformer},
author = {Shaoyu Chen and Tianheng Cheng and Xinggang Wang and Wenming Meng and Qian Zhang and Wenyu Liu},
journal= {arXiv preprint arXiv:2206.04584},
year = {2022}
}
备注
Tech report. Work in progress