HaLo-NeRF:学习几何引导语义以探索无约束照片集
计算机视觉与模式识别
2024-08-06 v2 图形学
摘要
包含由众多摄影师拍摄的照片的互联网图像集,展现出实现大规模旅游地标数字化探索的潜力。然而,先前的工作主要集中在几何重建和可视化上,忽视了语言在提供导航和细粒度理解的语义接口方面的关键作用。在受限的3D领域,最近的方法利用视觉-语言模型作为2D视觉语义的强先验。尽管这些模型对广泛的视觉语义展现出出色的理解能力,但它们在处理描绘此类旅游地标的无约束照片集时显得力不从心,因为它们缺乏建筑领域的专家知识。在这项工作中,我们提出了一个定位系统,通过利用SOTA视觉-语言模型并对其进行适配以理解地标场景语义,将描绘大规模地标的场景神经表示与描述场景内语义区域的文本相连接。为了用细粒度知识增强此类模型,我们利用了包含相似地标图像以及弱相关文本信息的大规模互联网数据。我们的方法建立在一个前提之上:在空间中具有物理基础的图像能够为定位新概念提供强大的监督信号,而这些概念的语义可以通过大语言模型从互联网文本元数据中解锁。我们利用场景视图之间的对应关系来引导对这些语义的空间理解,为3D兼容的分割提供指导,最终提升为体积场景表示。我们的结果表明,HaLo-NeRF能够准确定位与建筑地标相关的各种语义概念,超越了其他3D模型以及强大的2D分割基线的结果。我们的项目主页位于 https://tau-vailab.github.io/HaLo-NeRF/。
引用
@article{arxiv.2404.16845,
title = {HaLo-NeRF: Learning Geometry-Guided Semantics for Exploring Unconstrained Photo Collections},
author = {Chen Dudai and Morris Alper and Hana Bezalel and Rana Hanocka and Itai Lang and Hadar Averbuch-Elor},
journal= {arXiv preprint arXiv:2404.16845},
year = {2024}
}
备注
Eurographics 2024. Project page: https://tau-vailab.github.io/HaLo-NeRF/