VoxGRAF:基于稀疏体素网格的快速三维感知图像合成
计算机视觉与模式识别
2022-11-11 v3
摘要
最先进的三维感知生成模型依赖于基于坐标的 MLP 来参数化三维辐射场。尽管展示了令人印象深刻的结果,但对每条光线上的每个采样点查询 MLP 会导致渲染缓慢。因此,现有方法通常渲染低分辨率特征图,并用上采样网络处理它们以获得最终图像。尽管高效,神经渲染常常纠缠视角与内容,使得改变相机位姿会导致几何或外观的不期望变化。受近期基于体素的新视角合成结果的启发,我们在本文中研究了稀疏体素网格表示用于快速且三维一致生成建模的效用。我们的结果表明,当将稀疏体素网格与渐进式增长、自由空间剪枝和适当正则化相结合时,整体式 MLP 确实可以被三维卷积替代。为了获得场景的紧凑表示并允许扩展到更高体素分辨率,我们的模型将前景物体(以三维建模)与背景(以二维建模)解耦。与现有方法相比,我们的方法仅需单次前向传播即可生成完整三维场景。因此它允许从任意视角高效渲染,同时产生具有高视觉保真度的三维一致结果。
引用
@article{arxiv.2206.07695,
title = {VoxGRAF: Fast 3D-Aware Image Synthesis with Sparse Voxel Grids},
author = {Katja Schwarz and Axel Sauer and Michael Niemeyer and Yiyi Liao and Andreas Geiger},
journal= {arXiv preprint arXiv:2206.07695},
year = {2022}
}