中文

PETRv2:一种基于多相机图像的3D感知统一框架

计算机视觉与模式识别 2022-11-15 v3

摘要

在本文中,我们提出 PETRv2,一种基于多视角图像的3D感知统一框架。基于 PETR,PETRv2 探索了时序建模的有效性,利用先前帧的时序信息来提升3D目标检测。更具体地,我们扩展了 PETR 中的3D位置嵌入(3D PE)以用于时序建模。该3D PE 实现了不同帧在目标位置上的时序对齐。进一步引入了特征引导的位置编码器以提升3D PE的数据适应性。为支持多任务学习(如 BEV 分割和3D车道检测),PETRv2 通过引入在不同空间下初始化的任务特定查询,提供了一种简单而有效的解决方案。PETRv2 在3D目标检测、BEV 分割和3D车道检测上取得了最先进的性能。我们还对 PETR 框架进行了详细的鲁棒性分析。我们希望 PETRv2 能够作为3D感知的强基线。代码已发布于 \url{https://github.com/megvii-research/PETR}。

关键词

引用

@article{arxiv.2206.01256,
  title  = {PETRv2: A Unified Framework for 3D Perception from Multi-Camera Images},
  author = {Yingfei Liu and Junjie Yan and Fan Jia and Shuailin Li and Aqi Gao and Tiancai Wang and Xiangyu Zhang and Jian Sun},
  journal= {arXiv preprint arXiv:2206.01256},
  year   = {2022}
}

备注

Adding 3D lane detection results on OpenLane Dataset