面向3D语义场景完成的稀疏感知体素注意力与前景调制
计算机视觉与模式识别
2026-04-08 v1
摘要
单目语义场景完成(SSC)旨在从单张RGB图像重建完整的3D语义场景,为自动驾驶和机器人技术提供了一种经济的解决方案。然而,体素分布固有的不平衡性——超过93%的体素为空,前景类别罕见——带来了重大挑战。现有方法往往受到对无信息体素的冗余强调和对长尾类别泛化能力差的影响。为了解决这些问题,我们提出了VoxSAMNet(体素稀疏感知调制网络),一个统一框架,明确建模体素稀疏性和语义不平衡。我们的方法包括:(1)用于特征精炼的虚拟捷径(DSFR)模块,通过共享虚拟节点绕过空体素,同时用可变形注意力精炼被占据的体素;以及(2)前景调制策略,结合前景丢弃(FD)和文本引导图像滤波(TGIF),以缓解过拟合并增强类别相关特征。在公共基准SemanticKITTI和SSCBench-KITTI-360上的广泛实验表明,VoxSAMNet达到了最先进的性能,超越了先前的单目和立体基线,mIoU分数分别为18.2%和20.2%。我们的结果强调了稀疏感知和语义引导设计对高效准确的3D场景完成的重要性,为未来研究提供了一个有前景的方向。
引用
@article{arxiv.2604.05780,
title = {Sparsity-Aware Voxel Attention and Foreground Modulation for 3D Semantic Scene Completion},
author = {Yu Xue and Longjun Gao and Yuanqi Su and HaoAng Lu and Xiaoning Zhang},
journal= {arXiv preprint arXiv:2604.05780},
year = {2026}
}
备注
Accepted at CVPR 2026