NaviNeRF:基于 NeRF 的通过潜语义导航实现三维表示解耦
计算机视觉与模式识别
2024-03-29 v2
摘要
三维表示解耦旨在识别、分解并操控 3D 数据底层的解释性因子,这有助于 AI 从根本上理解我们的三维世界。该任务目前探索不足且带来巨大挑战:(i)3D 表示复杂且通常包含比 2D 图像多得多的信息;(ii)许多 3D 表示不适合基于梯度的优化,更不用说解耦。为应对这些挑战,我们使用 NeRF 作为可微分的 3D 表示,并引入一种自监督导航来识别潜空间中的可解释语义方向。据我们所知,这一称为 NaviNeRF 的新颖方法是首个无需任何先验或监督即可实现细粒度 3D 解耦的工作。具体而言,NaviNeRF 构建于生成式 NeRF 流程之上,并配备外导航分支与内细化分支。它们互补——外导航用于识别全局视角语义方向,内细化致力于细粒度属性。进一步设计了协同损失来协调两个分支。大量实验表明,NaviNeRF 具有优于先前 3D 感知模型的细粒度 3D 解耦能力。其性能也可与依赖语义或几何先验的面向编辑的模型相媲美。
引用
@article{arxiv.2304.11342,
title = {NaviNeRF: NeRF-based 3D Representation Disentanglement by Latent Semantic Navigation},
author = {Baao Xie and Bohan Li and Zequn Zhang and Junting Dong and Xin Jin and Jingyu Yang and Wenjun Zeng},
journal= {arXiv preprint arXiv:2304.11342},
year = {2024}
}