中文

GANFusion:基于 GAN 空间的前馈文本到 3D 扩散

计算机视觉与模式识别 2024-12-24 v1 机器学习

摘要

我们训练了一个仅使用单视图 2D 数据进行监督的文本到 3D 扩散生成器,用于人类角色。现有的 3D 生成模型尚无法匹配图像或视频生成模型的保真度。最先进的 3D 生成器要么需要显式的 3D 监督,因数据量和多样性受限;要么只能用 2D 数据监督,往往生成粗糙、无法文本条件化,或必须依赖测试时优化。我们观察到 GAN 和扩散生成器具有互补特性:GAN 可仅用 2D 监督高效训练,生成高质量 3D 物体,但难以进行文本条件化;而扩散模型可高效进行文本条件化,但仅用 2D 监督训练往往困难。我们提出 GANFusion,先通过仅用单视图 2D 数据训练的 GAN 架构生成无条件的三平面特征,用于 3D 数据;随后生成随机样本并进行标注,训练一个直接学习如何从良好三平面特征中采样的文本条件扩散模型,这些特征可解码为 3D 物体。

关键词

引用

@article{arxiv.2412.16717,
  title  = {GANFusion: Feed-Forward Text-to-3D with Diffusion in GAN Space},
  author = {Souhaib Attaiki and Paul Guerrero and Duygu Ceylan and Niloy J. Mitra and Maks Ovsjanikov},
  journal= {arXiv preprint arXiv:2412.16717},
  year   = {2024}
}

备注

https://ganfusion.github.io/