Point2Seq:将三维目标检测为序列
计算机视觉与模式识别
2022-03-28 v1
摘要
我们提出一个简单有效的框架 Point2Seq,用于从点云中进行三维目标检测。与以往通常一次性预测三维目标属性的方法不同,我们显式地建模三维目标各属性之间的相互依赖关系,从而获得更好的检测精度。具体而言,我们将每个三维目标视为一个词序列,并以自回归方式将三维目标检测任务重新表述为从三维场景中解码词语。我们进一步提出一个轻量级的场景到序列解码器,该解码器能够以三维场景的特征以及先前词语的线索为条件,自回归地生成词语。预测出的词语最终构成一组完整描述场景中三维目标的序列,然后通过基于相似性的序列匹配,将所有预测序列自动分配给相应的真实目标。我们的方法概念直观,可以轻松地接入大多数现有的三维检测主干网络,而不会增加过多的计算开销;另一方面,我们提出的序列化解码范式能够借助先前预测的词语,更好地利用复杂三维场景中的信息。无需任何额外的技巧,我们的方法显著优于先前基于锚点和基于中心点的三维目标检测框架,在具有挑战性的 ONCE 数据集和 Waymo 开放数据集上均取得了新的最优性能。代码可在 \url{https://github.com/ocNflag/point2seq} 获取。
引用
@article{arxiv.2203.13394,
title = {Point2Seq: Detecting 3D Objects as Sequences},
author = {Yujing Xue and Jiageng Mao and Minzhe Niu and Hang Xu and Michael Bi Mi and Wei Zhang and Xiaogang Wang and Xinchao Wang},
journal= {arXiv preprint arXiv:2203.13394},
year = {2022}
}
备注
To appear in CVPR2022