面向基于视觉的3D语义占据预测的三平面视图表示
计算机视觉与模式识别
2023-03-03 v2 人工智能
机器学习
摘要
现代以视觉为中心的自动驾驶感知方法广泛采用鸟瞰图(BEV)表示来描述3D场景。尽管相比体素表示具有更高的效率,但单一平面难以描述场景的细粒度3D结构。为此,我们提出一种三平面视图(TPV)表示,以两个额外的垂直平面辅助BEV。我们通过将3D空间中每个点在其三个平面上的投影特征求和来建模该点。为了将图像特征提升到3D TPV空间,我们进一步提出一种基于transformer的TPV编码器(TPVFormer)以有效获取TPV特征。我们采用注意力机制来聚合每个TPV平面中每个查询所对应的图像特征。实验表明,我们的模型在稀疏监督下训练可有效预测所有体素的语义占据。我们首次证明,仅使用相机输入即可在nuScenes的LiDAR分割任务上取得与基于LiDAR的方法相当的性能。代码:https://github.com/wzzheng/TPVFormer。
引用
@article{arxiv.2302.07817,
title = {Tri-Perspective View for Vision-Based 3D Semantic Occupancy Prediction},
author = {Yuanhui Huang and Wenzhao Zheng and Yunpeng Zhang and Jie Zhou and Jiwen Lu},
journal= {arXiv preprint arXiv:2302.07817},
year = {2023}
}
备注
Accepted to CVPR 2023. Code is available at https://github.com/wzzheng/TPVFormer