中文

COTR:用于基于视觉的 3D 占据预测的紧凑占据 Transformer

计算机视觉与模式识别 2024-04-12 v2

摘要

自动驾驶社区对 3D 占据预测表现出极大兴趣,这得益于其出色的几何感知和通用物体识别能力。为了实现这一点,当前的工作试图构建从鸟瞰图感知扩展而来的三透视视图(TPV)或占据(OCC)表示。然而,像 TPV 表示这样的压缩视图会丢失 3D 几何信息,而原始且稀疏的 OCC 表示需要庞大但冗余的计算成本。为了解决上述限制,我们提出了紧凑占据 Transformer(COTR),包含一个几何感知的占据编码器和一个语义感知的组解码器,以重建紧凑的 3D OCC 表示。占据编码器首先通过高效的显式-隐式视图变换生成紧凑的几何 OCC 特征。然后,占据解码器通过由粗到细的语义分组策略,进一步增强紧凑 OCC 表示的语义判别性。实验表明,在多个基线上都有显著的性能提升,例如,COTR 优于基线,相对提升 8%-15%,证明了我们方法的优越性。

关键词

引用

@article{arxiv.2312.01919,
  title  = {COTR: Compact Occupancy TRansformer for Vision-based 3D Occupancy Prediction},
  author = {Qihang Ma and Xin Tan and Yanyun Qu and Lizhuang Ma and Zhizhong Zhang and Yuan Xie},
  journal= {arXiv preprint arXiv:2312.01919},
  year   = {2024}
}

备注

CVPR2024. Code is available at https://github.com/NotACracker/COTR