中文

STCOcc:面向3D占据和场景流的稀疏时空级联修复

计算机视觉与模式识别 2025-04-29 v1

摘要

3D 占据和场景流提供了3D场景的详细且动态的表征。认识到3D空间的稀疏性和复杂性,先前的基于视觉的方法已采用隐式学习方法来建模空间和时间信息。然而,这些方法难以捕获局部细节,削弱了模型的空间判别能力。为此,我们提出了一种新颖的显式基于状态的建模方法,旨在利用占据状态来修复3D特征。具体而言,我们提出了一种稀疏的遮挡感知注意力机制,集成了级联细化策略,以准确地利用占据状态信息修复3D特征。此外,我们引入了一种用于建模长期动态相互作用的方法,降低了计算成本并保留了空间信息。与以往的最先进方法相比,我们的高效显式修复策略不仅在占据和场景流预测方面在 RayIoU 和 mAVE 上实现了卓越的性能,而且在训练期间显著降低了GPU内存使用量,将其降至8.7GB。我们的代码已在 https://github.com/lzzzzzm/STCOcc 上提供。

关键词

引用

@article{arxiv.2504.19749,
  title  = {STCOcc: Sparse Spatial-Temporal Cascade Renovation for 3D Occupancy and Scene Flow Prediction},
  author = {Zhimin Liao and Ping Wei and Shuaijia Chen and Haoxuan Wang and Ziyang Ren},
  journal= {arXiv preprint arXiv:2504.19749},
  year   = {2025}
}