3D-MAN:用于目标检测的3D多帧注意力网络
计算机视觉与模式识别
2021-03-31 v1
摘要
3D目标检测是自动驾驶与机器人技术中的重要模块。然而,许多现有方法侧重于使用单帧进行3D检测,并未充分利用来自多帧的信息。本文提出3D-MAN:一种3D多帧注意力网络,可有效聚合来自多视角的信息,并在Waymo Open Dataset上取得最先进性能。3D-MAN首先使用一种新颖的快速单帧检测器生成候选框。这些候选框及其对应的特征图随后被存储于记忆库中。我们设计了一个多视角对齐与聚合模块,利用注意力网络提取并聚合存储于记忆库中的时序特征。这有效结合了来自场景不同视角的特征。我们在大规模复杂的Waymo Open Dataset上展示了方法的有效性,与已发布的单帧及多帧方法相比取得了最先进结果。
引用
@article{arxiv.2103.16054,
title = {3D-MAN: 3D Multi-frame Attention Network for Object Detection},
author = {Zetong Yang and Yin Zhou and Zhifeng Chen and Jiquan Ngiam},
journal= {arXiv preprint arXiv:2103.16054},
year = {2021}
}