GOV-NeSF:可泛化的开放词汇神经语义场
计算机视觉与模式识别
2024-04-02 v1
摘要
视觉-语言基础模型的最新进展显著增强了开放词汇 3D 场景理解。然而,由于框架设计及其对 3D 数据的依赖,现有方法的泛化能力受到限制。我们通过引入可泛化的开放词汇神经语义场(GOV-NeSF)来解决这一限制,这是一种提供具有开放词汇语义的 3D 场景可泛化隐式表示的新方法。我们使用代价体聚合几何感知特征,并提出多视图联合融合模块,通过跨视图注意力机制聚合多视图特征,从而有效预测颜色和开放词汇特征的视图特定混合权重。值得注意的是,我们的 GOV-NeSF 在 2D 和 3D 开放词汇语义分割中均展现出 SOTA 性能,无需真实语义标签或深度先验,并且无需微调即可在场景和数据集之间有效泛化。
引用
@article{arxiv.2404.00931,
title = {GOV-NeSF: Generalizable Open-Vocabulary Neural Semantic Fields},
author = {Yunsong Wang and Hanlin Chen and Gim Hee Lee},
journal= {arXiv preprint arXiv:2404.00931},
year = {2024}
}