ECLIPSE:一种面向图像生成的资源高效文本到图像先验模型
计算机视觉与模式识别
2023-12-11 v1
摘要
文本到图像(T2I)扩散模型,尤其是 unCLIP 模型(如 DALL-E-2),在各种组合式 T2I 基准上达到了最先进(SOTA)性能,但代价是巨大的计算资源消耗。unCLIP 架构包含 T2I 先验模型和扩散图像解码器。与潜在扩散模型相比,仅 T2I 先验模型就增加了十亿级参数,从而提高了计算和高质量数据需求。我们提出 ECLIPSE,一种兼具参数效率与数据效率的新型对比学习方法。ECLIPSE 利用预训练的视觉-语言模型(如 CLIP)将知识蒸馏到先验模型中。我们证明,在资源受限条件下,仅使用 3.3% 的参数并在仅 2.8% 的数据上训练的 ECLIPSE 先验模型,以平均 71.6% 的偏好得分超越了基线 T2I 先验模型。它在遵循文本组合的能力方面也达到了与 SOTA 大模型相当的性能,平均偏好得分为 63.36%。在两个 unCLIP 扩散图像解码器 Karlo 和 Kandinsky 上的大量实验证实,ECLIPSE 先验模型在显著降低资源依赖的同时,始终能提供高性能。
引用
@article{arxiv.2312.04655,
title = {ECLIPSE: A Resource-Efficient Text-to-Image Prior for Image Generations},
author = {Maitreya Patel and Changhoon Kim and Sheng Cheng and Chitta Baral and Yezhou Yang},
journal= {arXiv preprint arXiv:2312.04655},
year = {2023}
}
备注
Project Page: https://eclipse-t2i.vercel.app/