LaTeRF:标签与文本驱动的物体辐射场
计算机视觉与模式识别
2022-09-05 v3
摘要
获取 3D 物体表示对于创建照片级真实感仿真以及收集 AR 和 VR 资产十分重要。神经场已展现出从 2D 图像学习场景连续体积表示的有效性,但从这些模型中以弱监督方式获取物体表示仍是一项开放挑战。本文中,我们引入 LaTeRF,一种在给定整场景 2D 图像、已知相机位姿、物体自然语言描述以及输入图像中物体与非物体点的一组点标签的情况下,从场景中提取感兴趣物体的方法。为忠实提取物体,LaTeRF 在每个 3D 点扩展 NeRF 公式并增加额外的“物体性”概率。此外,我们利用预训练 CLIP 模型的丰富潜空间结合我们的可微物体渲染器,来修复物体被遮挡的部分。我们在合成与真实世界数据集上展示了高保真物体提取,并通过广泛的消融研究论证了我们的设计选择。
引用
@article{arxiv.2207.01583,
title = {LaTeRF: Label and Text Driven Object Radiance Fields},
author = {Ashkan Mirzaei and Yash Kant and Jonathan Kelly and Igor Gilitschenski},
journal= {arXiv preprint arXiv:2207.01583},
year = {2022}
}