面向相机基语义场景完成的时序融合:突破视场范围限制
计算机视觉与模式识别
2026-01-21 v2
摘要
近期的相机基3D语义场景完成(SSC)方法日益关注利用时序线索丰富当前帧的特征。然而,这些方法主要聚焦于增强帧内区域,却难以重建靠近无人车侧边的关键越帧区域,尽管以往帧常包含有关这些不可见区域的有价值上下文信息。为此,我们提出了当前中心上下文3D融合(C3DFusion)模块,通过显式对齐来自当前帧和历史帧的提升点特征,生成具备隐藏区域感知的3D特征几何。C3DFusion通过两种互补技术实现增强时序融合——历史上下文模糊和当前特征稠密化——通过衰减不准确光束化历史点特征的尺度来抑制噪声,并通过增加点特征的体积贡献来增强当前点特征。仅集成到标准SSC架构中,C3DFusion便展现出显著有效性,在SemanticKITTI和SSCBench-KITTI-360数据集上显著优于最先进的方法。此外,它还展现出稳健的泛化能力,在应用于其他基线模型时也能实现显著的性能提升。
引用
@article{arxiv.2511.12498,
title = {Towards Temporal Fusion Beyond the Field of View for Camera-based Semantic Scene Completion},
author = {Jongseong Bae and Junwoo Ha and Jinnyeong Heo and Yeongin Lee and Ha Young Kim},
journal= {arXiv preprint arXiv:2511.12498},
year = {2026}
}
备注
Accepted to AAAI 2026