中文

InverseMatrixVT3D:一种基于投影矩阵的高效3D占用预测方法

计算机视觉与模式识别 2024-04-30 v2 机器人学

摘要

本文介绍了InverseMatrixVT3D,这是一种将多视图图像特征转换为3D特征体以进行3D语义占用预测的高效方法。现有的构建3D体的方法通常依赖于深度估计、设备特定算子或Transformer查询,这阻碍了3D占用模型的广泛采用。相比之下,我们的方法利用两个投影矩阵来存储静态映射关系,并利用矩阵乘法来高效生成全局鸟瞰图(Bird's Eye View, BEV)特征和局部3D特征体。具体来说,我们通过在图像特征图与两个稀疏投影矩阵之间执行矩阵乘法来实现这一点。我们为投影矩阵引入了一种稀疏矩阵处理技术,以优化GPU内存使用。此外,还提出了一个全局-局部注意力融合模块,以整合全局BEV特征与局部3D特征体,从而获得最终的3D体。我们还采用了一种多尺度监督机制来进一步提升性能。在nuScenes和SemanticKITTI数据集上进行的大量实验表明,我们的方法不仅因其简单性和有效性而脱颖而出,而且在检测弱势道路使用者(vulnerable road users, VRU)方面取得了顶级性能,这对于自动驾驶和道路安全至关重要。代码已开源:https://github.com/DanielMing123/InverseMatrixVT3D。

关键词

引用

@article{arxiv.2401.12422,
  title  = {InverseMatrixVT3D: An Efficient Projection Matrix-Based Approach for 3D Occupancy Prediction},
  author = {Zhenxing Ming and Julie Stephany Berrio and Mao Shan and Stewart Worrall},
  journal= {arXiv preprint arXiv:2401.12422},
  year   = {2024}
}