中文

基于统一梯度下降视角重新思考 3D 语义占据预测中的时间融合

计算机视觉与模式识别 2025-04-21 v2

摘要

我们提出了 GDFusion,一种用于基于视觉的 3D 语义占据预测(VisionOcc)的时序融合方法。GDFusion 聚焦于 VisionOcc 框架内的时序线索和融合策略,这是该框架中较少探索的时序融合方面。它系统性地检查整个 VisionOcc 管道,识别出三大基本且此前被忽视的时序线索:场景级一致性、运动校准和几何互补。这些线索捕捉了时序演变的不同方面,并在 VisionOcc 框架中的各个模块中作出 distinct 贡献。为了有效地跨异构表示融合时序信号,我们提出了一种新颖的融合策略,通过重新解释普通 RNN 的公式化方法来实现。这一重新解释利用特征上的梯度下降来统一整合多样化的时序信息,无缝地将提议的时序线索嵌入网络中。在 nuScenes 上的大量实验表明,GDFusion 显著优于既定基准。值得注意的是,在 Occ3D 基准上,它实现了 1.4%-4.8% 的 mIoU 提升,并将内存消耗降低了 27%-72%。

关键词

引用

@article{arxiv.2504.12959,
  title  = {Rethinking Temporal Fusion with a Unified Gradient Descent View for 3D Semantic Occupancy Prediction},
  author = {Dubing Chen and Huan Zheng and Jin Fang and Xingping Dong and Xianfei Li and Wenlong Liao and Tao He and Pai Peng and Jianbing Shen},
  journal= {arXiv preprint arXiv:2504.12959},
  year   = {2025}
}

备注

CVPR 2025