通过统一 GAN 框架实现一致的多模态生成
计算机视觉与模式识别
2023-07-06 v1
摘要
我们研究如何使用单一生成模型生成多模态图像输出,例如 RGB、深度和表面法线。挑战在于产生逼真的且彼此一致的输出。我们的解决方案构建于 StyleGAN3 架构之上,在合成网络的最后几层采用共享主干和模态特定分支,并提出了逐模态保真判别器和跨模态一致性判别器。在 Stanford2D3D 数据集上的实验中,我们展示了 RGB、深度和法线图像的逼真且一致的生成。我们还展示了一种训练方案,即使只有少量成对数据,也能在新域上轻松扩展我们的预训练模型。我们进一步评估了使用合成生成的 RGB 和深度对来训练或微调深度估计器的用途。代码将发布于 https://github.com/jessemelpolio/MultimodalGAN。
引用
@article{arxiv.2307.01425,
title = {Consistent Multimodal Generation via A Unified GAN Framework},
author = {Zhen Zhu and Yijun Li and Weijie Lyu and Krishna Kumar Singh and Zhixin Shu and Soeren Pirk and Derek Hoiem},
journal= {arXiv preprint arXiv:2307.01425},
year = {2023}
}
备注
In review