基于图神经网络与时空Transformer注意力的点云3D视频目标检测
计算机视觉与模式识别
2022-11-29 v1
摘要
以往基于LiDAR的3D目标检测工作主要聚焦于单帧范式。本文中,我们提出通过利用多帧中的时序信息(即点云视频)来检测3D目标。我们经验性地将时序信息划分为短期与长期模式。为编码短期数据,我们提出网格消息传递网络(GMPNet),其将每个网格(即分组后的点)视为节点,并与邻近网格构建k-NN图。为更新网格特征,GMPNet迭代地从邻居收集信息,从而挖掘邻近帧中网格的运动线索。为进一步聚合长期帧,我们提出注意力时空Transformer GRU(AST-GRU),其包含空间Transformer注意力(STA)模块与时间Transformer注意力(TTA)模块。STA与TTA增强了原始GRU,使其聚焦于小目标并更好地对齐运动目标。我们的整体框架支持点云中的在线与离线视频目标检测。我们基于流行的基于锚点与无锚点检测器实现了算法。在具有挑战性的nuScenes基准上的评估结果展示了我们方法的优越性能,在提交论文时无需任何额外技巧即登顶排行榜。
引用
@article{arxiv.2207.12659,
title = {Graph Neural Network and Spatiotemporal Transformer Attention for 3D Video Object Detection from Point Clouds},
author = {Junbo Yin and Jianbing Shen and Xin Gao and David Crandall and Ruigang Yang},
journal= {arXiv preprint arXiv:2207.12659},
year = {2022}
}