将NeRF引入潜在空间:逆图形自编码器
计算机视觉与模式识别
2025-02-25 v2
摘要
虽然预训练的图像自编码器在计算机视觉中的应用日益广泛,但在2D潜在空间中应用逆图形技术的研究却相对不足。然而,除了降低训练和渲染复杂度外,在潜在空间中应用逆图形还能实现与其他基于潜在空间的2D方法的宝贵互操作性。主要挑战在于,逆图形无法直接应用于此类图像潜在空间,因为它们缺乏底层3D几何结构。在本文中,我们提出了一个专门解决此问题的逆图形自编码器(IG-AE)。为此,我们通过将其潜在空间与联合训练的潜在3D场景对齐,用3D几何结构对图像自编码器进行正则化。我们利用训练好的IG-AE,通过一个潜在NeRF训练流程将NeRF引入潜在空间,我们在Nerfstudio框架的开源扩展中实现了该流程,从而为其支持的方法解锁了潜在场景学习。我们通过实验证实,与标准自编码器相比,使用IG-AE训练的潜在NeRF具有更高的质量,同时相对于在图像空间中训练的NeRF,其训练和渲染速度均有提升。我们的项目页面可在 https://ig-ae.github.io 找到。
引用
@article{arxiv.2410.22936,
title = {Bringing NeRFs to the Latent Space: Inverse Graphics Autoencoder},
author = {Antoine Schnepf and Karim Kassab and Jean-Yves Franceschi and Laurent Caraffa and Flavian Vasile and Jeremie Mary and Andrew Comport and Valerie Gouet-Brunet},
journal= {arXiv preprint arXiv:2410.22936},
year = {2025}
}
备注
Accepted at ICLR 2025. Available at https://openreview.net/forum?id=LTDtjrv02Y