中文

面向开放词汇 3D 场景理解的跨模态与不确定性感知层次聚类

计算机视觉与模式识别 2025-03-31 v2

摘要

缺乏大规模 3D-文本语料库导致近期研究者从视觉-语言模型(VLM)中蒸馏开放词汇知识。然而,这些方法通常依赖单一 VLM 在共同语言空间中对齐 3D 模型的特征空间,这限制了 3D 模型发挥多种基础模型所封装的多样化空间和语义能力的潜力。本文提出了一种名为 Cross-modal and Uncertainty-aware Agglomeration for Open-vocabulary 3D Scene Understanding 的方法,简称 CUA-O3D,是首个将 CLIP、DINOv2、Stable Diffusion 等多种基础模型整合到 3D 场景理解中的模型。我们进一步引入确定性不确定性估计,以适应性地蒸馏和调和来自这些模型的异构 2D 特征嵌入。我们的方法解决了两个关键挑战:(1) 将来自 VLMs 的语义先验与空间感知视觉基础模型的几何知识相结合;(2) 使用新颖的确定性不确定性估计捕获跨 diverse 语义和几何灵敏度的模型特定不确定性,从而在训练期间帮助调和异构表示。在 ScanNetV2 和 Matterport3D 上的大量实验表明,我们的方法不仅推进了开放词汇分割,还实现了稳健的跨域对齐和具竞争力的空间感知能力。代码将在 https://github.com/TyroneLi/CUA_O3D 发布。

关键词

引用

@article{arxiv.2503.16707,
  title  = {Cross-Modal and Uncertainty-Aware Agglomeration for Open-Vocabulary 3D Scene Understanding},
  author = {Jinlong Li and Cristiano Saltori and Fabio Poiesi and Nicu Sebe},
  journal= {arXiv preprint arXiv:2503.16707},
  year   = {2025}
}

备注

Accepted by CVPR 2025