在GAN中探索稀疏MoE用于文本条件图像合成
计算机视觉与模式识别
2023-09-08 v1
摘要
由于难以扩展规模,生成对抗网络(GANs)在文本条件图像合成任务上似乎正逐渐失宠。稀疏激活的专家混合(MoE)近期被证明是在有限计算资源下训练大规模模型的有效方案。受此思路启发,我们提出Aurora,一种基于GAN的文本到图像生成器,它采用一组专家学习特征处理,并配以稀疏路由器为各特征点选择最合适的专家。为了将采样的随机性与文本条件忠实解码至最终合成,我们的路由器通过考虑文本集成的全局潜码自适应地做出决策。在64x64图像分辨率下,我们的模型在LAION2B-en和COYO-700M上训练,在MS COCO上取得了6.2的零样本FID。我们发布代码与检查点以促进社区进一步发展。
引用
@article{arxiv.2309.03904,
title = {Exploring Sparse MoE in GANs for Text-conditioned Image Synthesis},
author = {Jiapeng Zhu and Ceyuan Yang and Kecheng Zheng and Yinghao Xu and Zifan Shi and Yujun Shen},
journal= {arXiv preprint arXiv:2309.03904},
year = {2023}
}
备注
Technical report