中文

GOV-NeSF:可泛化的开放词汇神经语义场

计算机视觉与模式识别 2024-04-02 v1

摘要

视觉-语言基础模型的最新进展显著增强了开放词汇 3D 场景理解。然而,由于框架设计及其对 3D 数据的依赖,现有方法的泛化能力受到限制。我们通过引入可泛化的开放词汇神经语义场(GOV-NeSF)来解决这一限制,这是一种提供具有开放词汇语义的 3D 场景可泛化隐式表示的新方法。我们使用代价体聚合几何感知特征,并提出多视图联合融合模块,通过跨视图注意力机制聚合多视图特征,从而有效预测颜色和开放词汇特征的视图特定混合权重。值得注意的是,我们的 GOV-NeSF 在 2D 和 3D 开放词汇语义分割中均展现出 SOTA 性能,无需真实语义标签或深度先验,并且无需微调即可在场景和数据集之间有效泛化。

关键词

引用

@article{arxiv.2404.00931,
  title  = {GOV-NeSF: Generalizable Open-Vocabulary Neural Semantic Fields},
  author = {Yunsong Wang and Hanlin Chen and Gim Hee Lee},
  journal= {arXiv preprint arXiv:2404.00931},
  year   = {2024}
}