通过结构性与纹理性表征学习的 3D 感知图像合成
计算机视觉与模式识别
2022-04-19 v2
摘要
使生成模型具备 3D 感知能力可桥接 2D 图像空间与 3D 物理世界,但仍具挑战性。近期尝试为生成对抗网络(GAN)配备神经辐射场(NeRF)作为 3D 先验,NeRF 将 3D 坐标映射到像素值。然而,NeRF 中的隐式函数具有非常局部的感受野,使生成器难以感知全局结构。同时,NeRF 基于体渲染构建,生成高分辨率结果的计算代价过高,增加了优化难度。为缓解这两个问题,我们提出一种称为 VolumeGAN 的新框架,通过显式学习结构表征与纹理表征来实现高保真 3D 感知图像合成。我们首先学习一个特征体来表示底层结构,随后使用类 NeRF 模型将其转换为特征场。该特征场进一步累积为 2D 特征图作为纹理表征,再由神经渲染器进行外观合成。这样的设计实现了对形状与外观的独立控制。在广泛数据集上的大量实验表明,我们的方法比先前方法取得了明显更高的图像质量和更好的 3D 控制。
引用
@article{arxiv.2112.10759,
title = {3D-aware Image Synthesis via Learning Structural and Textural Representations},
author = {Yinghao Xu and Sida Peng and Ceyuan Yang and Yujun Shen and Bolei Zhou},
journal= {arXiv preprint arXiv:2112.10759},
year = {2022}
}
备注
CVPR 2022 camera-ready, Project page: https://genforce.github.io/volumegan/