E$^{2}$GAN:用于图像到图像转换的高效生成对抗网络的高效训练
计算机视觉与模式识别
2024-06-04 v2 人工智能
机器学习
摘要
实现灵活的实时设备端图像编辑的一个极具前景的方向是,利用大规模文本到图像扩散模型生成用于训练生成对抗网络(GANs)的配对数据集,即数据蒸馏。这种方法显著缓解了使用扩散模型进行图像编辑时通常对高端商用GPU的严苛要求。然而,与文本到图像扩散模型不同,每个蒸馏出的GAN都专门用于特定的图像编辑任务,这需要耗费高昂的训练成本来获取适用于各种概念的模型。在这项工作中,我们引入并解决了一个新颖的研究方向:能否使从扩散模型蒸馏GAN的过程显著提高效率?为实现这一目标,我们提出了一系列创新技术。首先,我们构建了一个具有泛化特征的基GAN模型,可通过微调适应不同概念,从而无需从头训练。其次,我们识别出基GAN模型中的关键层,并采用低秩适应(Low-Rank Adaptation, LoRA)配合一个简单而有效的秩搜索过程,而非微调整个基模型。第三,我们研究了微调所需的最小数据量,进一步缩短了总体训练时间。大量实验表明,我们能够高效地赋予GAN在移动设备上执行实时高质量图像编辑的能力,同时显著降低每个概念的训练和存储成本。
引用
@article{arxiv.2401.06127,
title = {E$^{2}$GAN: Efficient Training of Efficient GANs for Image-to-Image Translation},
author = {Yifan Gong and Zheng Zhan and Qing Jin and Yanyu Li and Yerlan Idelbayev and Xian Liu and Andrey Zharkov and Kfir Aberman and Sergey Tulyakov and Yanzhi Wang and Jian Ren},
journal= {arXiv preprint arXiv:2401.06127},
year = {2024}
}
备注
ICML 2024. Project Page: https://yifanfanfanfan.github.io/e2gan/