测试时三维占用预测
计算机视觉与模式识别
2026-03-19 v4
摘要
自监督三维占用预测为理解复杂驾驶场景提供了一种有前景的解决方案,而无需昂贵的3D标注。然而,训练用于捕获细粒度几何和语义的密集占用解码器可能需要数百GPU小时,并且一旦训练完成,此类模型在没有大量重新训练的情况下难以适应不同的体素分辨率或新目标类别。为了克服这些局限性,我们提出了一个实用且灵活的测试时占用预测框架TT-Occ。我们的方法通过运行时集成视觉基础模型(VFMs),从原始传感器流中增量构建、优化和体素化具有时间感知能力的3D高斯分布。3D高斯分布的灵活表示使得可以在任意用户指定的分辨率下进行体素化,而VFMs的强大泛化能力支持准确的感知和开放词汇识别,无需任何网络训练或微调。为了验证我们框架的通用性和有效性,我们提供了两个变体:基于LiDAR的版本和以视觉为中心的版本,并在不同体素分辨率下在Occ3D-nuScenes和nuCraft基准测试上进行了广泛实验。实验结果表明,TT-Occ显著优于现有的计算昂贵的预训练自监督对应方法。代码可在 https://github.com/Xian-Bei/TT-Occ 获取。
引用
@article{arxiv.2503.08485,
title = {Test-Time 3D Occupancy Prediction},
author = {Fengyi Zhang and Xiangyu Sun and Huitong Yang and Zheng Zhang and Zi Huang and Yadan Luo},
journal= {arXiv preprint arXiv:2503.08485},
year = {2026}
}
备注
CVPR 2026