TextCraftor:你的文本编码器可以是图像质量控制器
计算机视觉与模式识别
2024-03-29 v1 人工智能
机器学习
摘要
基于扩散的文本到图像生成模型(例如 Stable Diffusion)彻底改变了内容生成领域,在图像编辑和视频合成等领域实现了显著进步。尽管这些模型功能强大,但并非没有局限性。合成与输入文本高度对齐的图像仍然具有挑战性,需要使用精心设计的提示进行多次运行才能获得满意的结果。为了减轻这些局限性,许多研究致力于利用各种技术微调预训练的扩散模型(即 UNet)。然而,在这些努力中,文本到图像扩散模型训练的一个关键问题在很大程度上尚未被探索:是否可能且可行通过微调文本编码器来提升文本到图像扩散模型的性能?我们的研究结果表明,无需将 Stable Diffusion 中使用的 CLIP 文本编码器替换为其他大型语言模型,我们可以通过我们提出的微调方法 TextCraftor 对其进行增强,从而在定量基准和人类评估中带来显著改善。有趣的是,我们的技术还通过对使用不同奖励微调的文本编码器进行插值,实现了可控的图像生成。我们还证明 TextCraftor 与 UNet 微调是正交的,并且可以结合使用以进一步提升生成质量。
引用
@article{arxiv.2403.18978,
title = {TextCraftor: Your Text Encoder Can be Image Quality Controller},
author = {Yanyu Li and Xian Liu and Anil Kag and Ju Hu and Yerlan Idelbayev and Dhritiman Sagar and Yanzhi Wang and Sergey Tulyakov and Jian Ren},
journal= {arXiv preprint arXiv:2403.18978},
year = {2024}
}