FMOcc:基于 TPV 驱动流匹配与选择性状态空间模型的 3D 占据预测
计算机视觉与模式识别
2025-07-04 v1
摘要
3D 语义占据预测在自动驾驶中发挥着关键作用。然而,少帧图像的固有局限性以及 3D 空间中的冗余性,损害了对遮挡和远距离场景的预测精度。现有方法通过融合历史帧数据来提升性能,这需要额外的数据和大量的计算资源。为解决这些问题,本文提出 FMOcc,一种结合流匹配选择性状态空间模型的三视角细化占据网络,用于少帧 3D 占据预测。首先,为了生成缺失特征,我们设计了基于流匹配模型的特征细化模块,称为 Flow Matching SSM 模块 (FMSSM)。此外,通过设计 TPV SSM 层和平面选择性 SSM (PS3M),我们选择性过滤 TPV 特征,以降低空气体素对非空气体素的影响,从而提升模型的整体效率和远距离场景的预测能力。最后,我们设计了掩码训练 方法以增强 FMOcc 的鲁棒性,并解决传感器数据丢失问题。在 Occ3D-nuScenes 和 OpenOcc 数据集上的实验结果表明,我们的 FMOcc 优于现有的 SOTA 方法。我们的 FMOcc 在两帧输入下,在 Occ3D-nuScenes 验证集上取得了 43.1% RayIoU 和 39.8% mIoU 的显著分数,在 OpenOcc 上取得了 42.6% RayIoU,推理内存为 5.4 G,推理时间为 330ms。
引用
@article{arxiv.2507.02250,
title = {FMOcc: TPV-Driven Flow Matching for 3D Occupancy Prediction with Selective State Space Model},
author = {Jiangxia Chen and Tongyuan Huang and Ke Song},
journal= {arXiv preprint arXiv:2507.02250},
year = {2025}
}