中文

基于LiDAR的在线三维视频目标检测:图消息传递与时空Transformer注意力

计算机视觉与模式识别 2020-04-06 v1

摘要

现有基于LiDAR的三维目标检测器通常聚焦于单帧检测,而忽略连续点云帧中的时空信息。本文提出一种在点云序列上运行的端到端在线三维视频目标检测器。所提模型包含空间特征编码组件与时空特征聚合组件。在前一组件中,提出新颖的柱体消息传递网络(PMPNet)以编码每帧离散点云。其通过迭代消息传递自适应地从邻域收集柱体节点信息,有效扩大柱体特征的感受野。在后一组件中,我们提出注意力时空Transformer GRU(AST-GRU)以聚合时空信息,其通过注意力记忆门控机制增强常规ConvGRU。AST-GRU包含空间Transformer注意力(STA)模块与时间Transformer注意力(TTA)模块,分别可强调前景物体与对齐动态物体。实验结果表明,所提三维视频目标检测器在大规模nuScenes基准上取得最先进性能。

关键词

引用

@article{arxiv.2004.01389,
  title  = {LiDAR-based Online 3D Video Object Detection with Graph-based Message Passing and Spatiotemporal Transformer Attention},
  author = {Junbo Yin and Jianbing Shen and Chenye Guan and Dingfu Zhou and Ruigang Yang},
  journal= {arXiv preprint arXiv:2004.01389},
  year   = {2020}
}

备注

Accepted to CVPR 2020. Code: https://github.com/yinjunbo/3DVID