中文

通过捕获动态表示的基于视觉的 3D 语义场景补全

计算机视觉与模式识别 2025-05-06 v2

摘要

基于视觉的语义场景补全任务旨在从 2D 图像预测稠密的几何与语义 3D 场景表示。然而,场景中动态物体的存在严重影响了模型从 2D 图像推断 3D 结构的准确性。现有方法简单地堆叠多帧图像输入以增加稠密的场景语义信息,却忽略了动态物体和无纹理区域违背多视图一致性与匹配可靠性这一事实。为解决这些问题,我们提出了一种新方法 CDScene:通过捕获动态表示的基于视觉的鲁棒语义场景补全。首先,我们利用多模态大模型提取 2D 显式语义,并将其对齐到 3D 空间。其次,我们利用单目和立体深度的特性,将场景信息解耦为动态和静态特征。动态特征包含围绕动态物体的结构关系,静态特征包含稠密的上下文空间信息。最后,我们设计了一个动静态自适应融合模块,以有效提取和聚合互补特征,在自动驾驶场景中实现鲁棒且准确的语义场景补全。在 SemanticKITTI、SSCBench-KITTI360 和 SemanticKITTI-C 数据集上的大量实验结果证明了 CDScene 相对于现有 SOTA 方法的优越性和鲁棒性。

关键词

引用

@article{arxiv.2503.06222,
  title  = {Vision-based 3D Semantic Scene Completion via Capture Dynamic Representations},
  author = {Meng Wang and Fan Wu and Yunchuan Qin and Ruihui Li and Zhuo Tang and Kenli Li},
  journal= {arXiv preprint arXiv:2503.06222},
  year   = {2025}
}