中文

UniD-Shift:面向统一语义分割的可解释共享-私有多模态分解

计算机视觉与模式识别 2026-05-11 v1

摘要

大规模 3D 点云的语义分割对自动驾驶和城市数字孪生等应用至关重要。然而,激光雷达的稀疏采样模式和图像观测中基于视点的几何畸变 complicate 了跨模态对齐,阻碍了稳定的融合。受到相机捕获的 2D 图像是 3D 世界表征的启发,我们认识到从 2D 和 3D 分割中学习的特征在某些共同语义方面具有共享性,而另一些方面则保持模态特定性。这一洞察激发了我们构建一种用于联合 2D-3D 语义分割的统一多模态框架。我们将基于 SAM 的视觉编码器与基于 SPTNet 的几何编码器相结合,以提取互补的语义和几何表征。来自两个模态的 resulting 特征被显式地分解为共享和私有子空间,其中共享成分总结了两个域共有的语义因素,私有成分保留了每个模态独有的属性。一个轻量级基于注意力的融合模块将共享特征聚合为一致的跨模态表示,正则化训练目标确保语义对齐和子空间独立性。在 SemanticKITTI 和 nuScenes 基准测试上进行的实验表明,我们的 UniD-Shift 在语义分割准确率上优于代表性的多模态基线,同时具备竞争的计算效率。跨域评估在 nuScenes USA-Singapore 上显示,在分布迁移下仍能保持稳定性能,证明了强大的泛化能力。实现代码已公开于:https://github.com/shuaizhang69/UniD-Shift

关键词

引用

@article{arxiv.2605.07356,
  title  = {UniD-Shift: Towards Unified Semantic Segmentation via Interpretable Share-Private Multimodal Decomposition},
  author = {Shuai Zhang and Zhecheng Shi and Zhuxiao Li and Jing Ou and Tengxi Wang and Yuan Liu and Wufan Zhao},
  journal= {arXiv preprint arXiv:2605.07356},
  year   = {2026}
}