OpenNeRF:基于像素级特征和渲染新视角的开放集 3D 神经场景分割
计算机视觉与模式识别
2024-04-05 v1
摘要
大型视觉语言模型(VLM),如 CLIP,使开放集图像分割成为可能,通过 zero-shot 方式分割图像中任意概念。这是对传统封闭集假设的扩展,即模型只能分割预定义训练集中的类别。最近,首批针对 3D 场景开放集分割的方法出现在文献中。这些方法受封闭集 3D 卷积方法的影响,这些方法处理点云或多边形网格。然而,这些 3D 场景表示与视觉语言模型基于图像的方法不太一致。事实上,点云和 3D 网格通常比图像分辨率低,而重建的 3D 场景几何可能无法良好地投影到用于计算 pixel-aligned CLIP 特征的底层 2D 图像序列上。为此,我们提出 OpenNeRF,自然地在 posed 图像上运行,并直接将 VLM 特征编码到 NeRF 中。这类似于 LERF 的精神,但我们的工作表明,使用像素级 VLM 特征(而不是全局 CLIP 特征)结果导致整体结构更简单,而无需额外的 DINO 正则化。我们的 OpenNeRF 进一步利用 NeRF 能够渲染新视角并从初始 posed 图像中观察不充分的区域提取开放集 VLM 特征。对于 Replica 数据集上的 3D 点云分割,OpenNeRF 在 LERF 和 OpenScene 等最新开放词汇方法之上至少提高了 +4.9 mIoU。
引用
@article{arxiv.2404.03650,
title = {OpenNeRF: Open Set 3D Neural Scene Segmentation with Pixel-Wise Features and Rendered Novel Views},
author = {Francis Engelmann and Fabian Manhardt and Michael Niemeyer and Keisuke Tateno and Marc Pollefeys and Federico Tombari},
journal= {arXiv preprint arXiv:2404.03650},
year = {2024}
}
备注
ICLR 2024, Project page: https://opennerf.github.io