针对基于摄像头的三维语义场景完成的体素稀疏性多分辨率对齐
计算机视觉与模式识别
2026-02-04 v1
摘要
基于摄像头的三维语义场景完成(SSC)为评估周围三维场景中每个体素的几何占据情况和语义标签提供了具有成本效益的解决方案,为感知-预测-规划式自动驾驶系统提供了基于体素的场景感知基础。尽管已对现有方法取得了显著进展,但它们的优化仅依赖体素标签监督,面临体素稀疏性挑战——在自动驾驶场景中,大比例体素为空,用以限制优化效率和模型性能。为解决此问题,我们提出一种\textit{多分辨率对齐(MRA)\}方法,用于缓解基于摄像头的三维语义场景完成中的体素稀疏性,该方法通过跨多分辨率三维特征的场景级和实例级对齐作为辅助监督。具体而言,我们首先提出了多分辨率视图变换模块,将 2D 图像特征投影到多分辨率三维特征,并通过融合判别性种子特征在场景层面进行对齐。进一步,我们设计了三次语义各向异性模块,以识别每个体素的实例级语义重要性,考虑特定体素在立方体区域内相对于其相邻体素的语义差异。最后,我们构建了关键分布对齐模块,依据立方体语义各向异性选择关键体素作为实例级锚点,并对不同分辨率之间关键特征分布的一致性应用循环损失作为辅助监督。代码已公开于 https://github.com/PKU-ICST-MIPL/MRA_TIP。
引用
@article{arxiv.2602.03371,
title = {Multi-Resolution Alignment for Voxel Sparsity in Camera-Based 3D Semantic Scene Completion},
author = {Zhiwen Yang and Yuxin Peng},
journal= {arXiv preprint arXiv:2602.03371},
year = {2026}
}
备注
15 pages, 6 figures, accepted by TIP 2026