效率不妥协:提升多样性的 CLIP 辅助文本到图像 GAN
计算机视觉与模式识别
2025-06-03 v1 机器学习
摘要
最近,生成对抗网络(GANs)已成功扩展到十亿级别的大规模文本到图像数据集。然而,训练此类模型需要高昂的训练成本,限制了部分应用和研究使用。为了降低成本,一个有前景的方向是引入预训练模型。与其它大规模 GANs 相比,利用预训练模型作为生成器的现有方法显著降低了训练成本,但我们发现该模型在给定提示下的生成多样性大幅下降。为了构建高效且高保真的文本到图像 GAN 而不妥协,我们提出使用两个专门针对文本到图像任务适配的切片对抗网络(SANs)判别器。我们提出的模型称为 SCAD,在给定提示下显示出显著的多样性增强,并具有更好的样本保真度。我们还提出使用一种称为每提示多样性(PPD)的指标来定量评估文本到图像模型的多样性。SCAD 实现了与最新大规模 GANs 相当的 zero-shot FID,且训练成本降低了两个数量级。
引用
@article{arxiv.2506.01493,
title = {Efficiency without Compromise: CLIP-aided Text-to-Image GANs with Increased Diversity},
author = {Yuya Kobayashi and Yuhta Takida and Takashi Shibuya and Yuki Mitsufuji},
journal= {arXiv preprint arXiv:2506.01493},
year = {2025}
}
备注
Accepted at IJCNN 2025