中文

在GAN中探索稀疏MoE用于文本条件图像合成

计算机视觉与模式识别 2023-09-08 v1

摘要

由于难以扩展规模,生成对抗网络(GANs)在文本条件图像合成任务上似乎正逐渐失宠。稀疏激活的专家混合(MoE)近期被证明是在有限计算资源下训练大规模模型的有效方案。受此思路启发,我们提出Aurora,一种基于GAN的文本到图像生成器,它采用一组专家学习特征处理,并配以稀疏路由器为各特征点选择最合适的专家。为了将采样的随机性与文本条件忠实解码至最终合成,我们的路由器通过考虑文本集成的全局潜码自适应地做出决策。在64x64图像分辨率下,我们的模型在LAION2B-en和COYO-700M上训练,在MS COCO上取得了6.2的零样本FID。我们发布代码与检查点以促进社区进一步发展。

关键词

引用

@article{arxiv.2309.03904,
  title  = {Exploring Sparse MoE in GANs for Text-conditioned Image Synthesis},
  author = {Jiapeng Zhu and Ceyuan Yang and Kecheng Zheng and Yinghao Xu and Zifan Shi and Yujun Shen},
  journal= {arXiv preprint arXiv:2309.03904},
  year   = {2023}
}

备注

Technical report