ALOcc:基于自适应升降的 3D 语义占据与基于成本体积的流预测
计算机视觉与模式识别
2025-09-11 v2
摘要
3D 语义占据和流预测是时空场景理解的基本任务。本文提出一种基于视觉的框架,包含三个目标性改进。首先,我们引入一种集成深度去噪的遮挡感知自适应升降机制,以增强 2D 到 3D 特征转换的鲁棒性,同时减轻对深度先验的依赖。其次,通过联合优化原型并利用置信度和类别感知的采样来实现 3D-2D 语义一致性,以解决长尾类别问题。最后,为简化联合预测,我们设计一种基于 BEV 的成本体积,显式地关联语义和流特征,并通过混合分类-回归方案进行监督,以处理多样化的运动尺度。我们的纯卷积架构在多个基准测试上实现了语义占据和联合占据语义-流预测的新型最佳性能。我们还 presented 一系列模型,提供了效率与性能之间的多样化权衡。我们的实时版本在速度和准确性上均超越了现有所有实时方法,确保了其实际可行性。
引用
@article{arxiv.2411.07725,
title = {ALOcc: Adaptive Lifting-Based 3D Semantic Occupancy and Cost Volume-Based Flow Predictions},
author = {Dubing Chen and Jin Fang and Wencheng Han and Xinjing Cheng and Junbo Yin and Chenzhong Xu and Fahad Shahbaz Khan and Jianbing Shen},
journal= {arXiv preprint arXiv:2411.07725},
year = {2025}
}
备注
ICCV 2025