OV-NeRF:结合视觉与语言基础模型的开放词汇神经辐射场用于 3D 语义理解
计算机视觉与模式识别
2024-09-24 v2
摘要
神经辐射场的发展为封装 3D 场景的几何和外观特征提供了强大的表示。增强 NeRF 在开放词汇 3D 语义感知任务中的能力一直是近期的焦点。然而,当前直接从对比语言-图像预训练中提取语义进行语义场学习的方法,由于 CLIP 提供的语义存在噪声且视角不一致而面临困难。为了解决这些局限性,我们提出了 OV-NeRF,该方法利用预训练视觉与语言基础模型的潜力,通过提出的单视图和跨视图策略来增强语义场学习。首先,从单视图角度,我们利用从 Segment Anything (SAM) 导出的 2D 掩码提议引入区域语义排序正则化,以纠正每个训练视图的噪声语义,促进准确的语义场学习。其次,从跨视图角度,我们提出了一种跨视图自增强策略,以应对视角不一致语义带来的挑战。CSE 并非始终利用来自 CLIP 的 2D 不一致语义,而是利用从训练良好的语义场本身生成的 3D 一致语义进行语义场训练,旨在减少歧义并增强不同视图间的整体语义一致性。大量实验验证了我们的 OV-NeRF 优于当前最先进的方法,在 Replica 和 ScanNet 上的 mIoU 指标分别取得了 20.31% 和 18.42% 的显著提升。此外,我们的方法在各种 CLIP 配置下均表现出持续优异的结果,进一步验证了其鲁棒性。项目页面:https://github.com/pcl3dv/OV-NeRF。
引用
@article{arxiv.2402.04648,
title = {OV-NeRF: Open-vocabulary Neural Radiance Fields with Vision and Language Foundation Models for 3D Semantic Understanding},
author = {Guibiao Liao and Kaichen Zhou and Zhenyu Bao and Kanglin Liu and Qing Li},
journal= {arXiv preprint arXiv:2402.04648},
year = {2024}
}
备注
IEEE TCSVT 2024: https://ieeexplore.ieee.org/document/10630553