面向自动驾驶中基于3D激光雷达视频目标检测的时空-通道Transformer
计算机视觉与模式识别
2020-11-30 v1
摘要
工业界对自动驾驶的强烈需求引发了人们对3D目标检测的浓厚兴趣,并催生了许多优秀的3D目标检测算法。然而,绝大多数算法仅对单帧数据建模,忽略了数据序列的时间信息。在本工作中,我们提出一种称为时空-通道Transformer(Temporal-Channel Transformer)的新Transformer,用于对激光雷达数据的视频目标检测建模时空域与通道域关系。作为该Transformer的特殊设计,编码器中所编码的信息与解码器中的不同,即编码器编码多帧的时空-通道信息,而解码器以体素方式解码当前帧的空间-通道信息。具体而言,该Transformer的时空-通道编码器被设计为利用来自不同通道与帧的特征间相关性来编码不同通道与帧的信息。另一方面,该Transformer的空间解码器将解码当前帧各位置的信息。在使用检测头进行目标检测之前,部署门机制以重新校准当前帧特征,其通过在上采样过程中反复细化目标帧的表示来过滤掉与物体无关的信息。实验结果表明,我们在nuScenes基准上取得了基于栅格体素的3D目标检测的最优性能。
引用
@article{arxiv.2011.13628,
title = {Temporal-Channel Transformer for 3D Lidar-Based Video Object Detection in Autonomous Driving},
author = {Zhenxun Yuan and Xiao Song and Lei Bai and Wengang Zhou and Zhe Wang and Wanli Ouyang},
journal= {arXiv preprint arXiv:2011.13628},
year = {2020}
}