面向开放词汇场景理解的语言嵌入 3D 高斯表示
计算机视觉与模式识别
2023-12-01 v1 图形学
摘要
3D 空间中的开放词汇查询具有挑战性,但对物体定位与分割等场景理解任务至关重要。语言嵌入的场景表示通过将语言特征融入 3D 空间取得了进展。然而,其效能严重依赖于在训练和渲染中资源密集的神经网络。尽管近期 3D 高斯实现了高效且高质量的新视角合成,但直接在其中嵌入语言特征会导致内存占用过高且性能下降。本文中,我们引入语言嵌入 3D 高斯,一种用于开放词汇查询任务的新型场景表示。我们未在高斯上嵌入高维原始语义特征,而是提出一种专门的量化方案以大幅缓解内存需求,以及一种新颖的嵌入流程,可实现更平滑且高精度的查询,从而应对基于点的表示中的多视角特征不一致性与高频归纳偏置。我们的综合实验表明,该表示在当前的语言嵌入表示中实现了最佳的视觉质量与语言查询精度,同时在单张桌面 GPU 上保持实时渲染帧率。
引用
@article{arxiv.2311.18482,
title = {Language Embedded 3D Gaussians for Open-Vocabulary Scene Understanding},
author = {Jin-Chuan Shi and Miao Wang and Hao-Bin Duan and Shao-Hua Guan},
journal= {arXiv preprint arXiv:2311.18482},
year = {2023}
}