解放语义与几何先验:用于 3D 场景完善的 FoundationSSC
计算机视觉与模式识别
2026-01-16 v2
摘要
基于摄像机的 3D 语义场景完善(SSC)为自动驾驶和机器人导航提供稠密的几何和语义感知。然而,现有方法依赖于集成编码器同时提供语义和几何先验,这迫使模型在冲突需求之间做出权衡,从而限制了整体性能。为解决这些挑战,我们提出了 FoundationSSC,一种在源和路径两个层面进行双重解耦的新框架。在源层面,我们引入一个基础编码器,为语义分支提供丰富的语义特征先验,为几何分支提供高保真立体成本体积。在路径层面,这些先验通过专门的解耦路径进行细化,产生优异的语义语境和深度分布。我们的双重解耦设计产生解耦且细化的输入,然后用于混合视图变换以生成互补的 3D 特征。此外,我们引入了新的轴向感知融合(Axis-Aware Fusion, AAF)模块,以解决特征融合中常被忽视的挑战,通过各向异性将其融合到统一表示中。广泛的实验表明,FoundationSSC 的优势显而易见,在 SemanticKITTI 上实现语义和几何指标的同步提升,分别超过前所未有的 +0.23 mIoU 和 +2.03 IoU。此外,我们在 SSCBench-KITTI-360 上实现了最先进的性能,mIoU 为 21.78,IoU 为 48.61。
引用
@article{arxiv.2508.13601,
title = {Unleashing Semantic and Geometric Priors for 3D Scene Completion},
author = {Shiyuan Chen and Wei Sui and Bohao Zhang and Zeyd Boukhers and John See and Cong Yang},
journal= {arXiv preprint arXiv:2508.13601},
year = {2026}
}
备注
Accept by AAAI-2026