COTR:用于基于视觉的 3D 占据预测的紧凑占据 Transformer
计算机视觉与模式识别
2024-04-12 v2
摘要
自动驾驶社区对 3D 占据预测表现出极大兴趣,这得益于其出色的几何感知和通用物体识别能力。为了实现这一点,当前的工作试图构建从鸟瞰图感知扩展而来的三透视视图(TPV)或占据(OCC)表示。然而,像 TPV 表示这样的压缩视图会丢失 3D 几何信息,而原始且稀疏的 OCC 表示需要庞大但冗余的计算成本。为了解决上述限制,我们提出了紧凑占据 Transformer(COTR),包含一个几何感知的占据编码器和一个语义感知的组解码器,以重建紧凑的 3D OCC 表示。占据编码器首先通过高效的显式-隐式视图变换生成紧凑的几何 OCC 特征。然后,占据解码器通过由粗到细的语义分组策略,进一步增强紧凑 OCC 表示的语义判别性。实验表明,在多个基线上都有显著的性能提升,例如,COTR 优于基线,相对提升 8%-15%,证明了我们方法的优越性。
引用
@article{arxiv.2312.01919,
title = {COTR: Compact Occupancy TRansformer for Vision-based 3D Occupancy Prediction},
author = {Qihang Ma and Xin Tan and Yanyun Qu and Lizhuang Ma and Zhizhong Zhang and Yuan Xie},
journal= {arXiv preprint arXiv:2312.01919},
year = {2024}
}
备注
CVPR2024. Code is available at https://github.com/NotACracker/COTR