中文

VLScene:用于基于相机的 3D 语义场景补全的视觉-语言引导蒸馏

计算机视觉与模式识别 2025-03-11 v1

摘要

基于相机的 3D 语义场景补全 (SSC) 为自动驾驶提供密集的几何与语义感知。然而,图像提供的信息有限,使得模型容易受到由遮挡和透视畸变引起的几何模糊的影响。现有方法通常缺乏物体之间显式的语义建模,限制了其对 3D 语义上下文的感知。为了应对这些挑战,我们提出了一种新方法 VLScene:用于基于相机的 3D 语义场景补全的视觉-语言引导蒸馏。其核心思想是利用视觉-语言模型引入高级语义先验,以提供 3D 场景理解所需的物体空间上下文。具体而言,我们设计了一个视觉-语言引导蒸馏过程来增强图像特征,该过程能有效从周围环境中捕获语义知识并改善空间上下文推理。此外,我们引入了一种几何-语义稀疏感知机制,以在邻域内传播几何结构并通过上下文稀疏交互增强语义信息。实验结果表明,VLScene 在 SemanticKITTI 和 SSCBench-KITTI-360 等具有挑战性的基准测试上取得了第一名,分别获得了 17.52 和 19.10 的显著 mIoU 分数。

关键词

引用

@article{arxiv.2503.06219,
  title  = {VLScene: Vision-Language Guidance Distillation for Camera-Based 3D Semantic Scene Completion},
  author = {Meng Wang and Huilong Pi and Ruihui Li and Yunchuan Qin and Zhuo Tang and Kenli Li},
  journal= {arXiv preprint arXiv:2503.06219},
  year   = {2025}
}

备注

Accept by AAAI-2025(Oral)