TGP:基于3D高斯与稀疏点云的双模态占用预测用于3D环境感知
计算机视觉与模式识别
2025-03-14 v1 人工智能
摘要
3D语义占用因其能提供更真实的几何感知以及与下游任务更紧密的集成,迅速成为机器人和自动驾驶环境感知领域的研究热点。通过对环境中3D空间的占用预测,可以有效提高场景理解的能力和鲁棒性。然而,现有的占用预测任务主要使用基于体素或基于点云的方法进行建模:基于体素的网络结构常常因体素化过程而遭受空间信息丢失的问题,而基于点云的方法虽然能更好地保留空间位置信息,但在表示体积结构细节方面存在局限性。为解决这一问题,我们提出了一种基于3D高斯集和稀疏点云的双模态预测方法,该方法平衡了空间位置和体积结构信息,在语义占用预测中实现了更高的精度。具体来说,我们的方法采用基于Transformer的架构,将3D高斯集、稀疏点云和查询作为输入。通过Transformer的多层结构,增强的查询和3D高斯集共同促进语义占用预测,自适应融合机制整合两种模态的语义输出以生成最终预测结果。此外,为了进一步提高精度,我们在每一层动态细化点云,从而在占用预测期间获得更精确的位置信息。我们在Occ3DnuScenes数据集上进行了实验,实验结果表明所提方法在基于IoU的指标上具有优越性能。
引用
@article{arxiv.2503.09941,
title = {TGP: Two-modal occupancy prediction with 3D Gaussian and sparse points for 3D Environment Awareness},
author = {Mu Chen and Wenyu Chen and Mingchuan Yang and Yuan Zhang and Tao Han and Xinchi Li and Yunlong Li and Huaici Zhao},
journal= {arXiv preprint arXiv:2503.09941},
year = {2025}
}