ELLA:为大语言模型配备扩散模型以增强语义对齐
计算机视觉与模式识别
2024-03-11 v1
摘要
扩散模型在文本到图像生成领域展现了卓越性能。然而,大多数广泛使用的模型仍采用 CLIP 作为文本编码器,这限制了它们理解密集提示(dense prompts)的能力,包括多对象、详细属性、复杂关系、长文本对齐等。在本文中,我们引入了一种高效的大语言模型适配器,称为 ELLA,它为文本到图像扩散模型配备了强大的大语言模型(LLM),以增强文本对齐能力,且无需训练 U-Net 或 LLM。为了无缝桥接两个预训练模型,我们研究了一系列语义对齐连接器设计,并提出了一种新颖模块——时间步感知语义连接器(TSC),它能从 LLM 中动态提取依赖于时间步的条件。我们的方法在去噪过程的不同阶段适应语义特征,协助扩散模型在采样时间步上解释冗长且复杂的提示。此外,ELLA 可轻松与社区模型和工具集成,以提升其提示跟随能力。为了评估文本到图像模型在密集提示跟随方面的表现,我们引入了密集提示图基准(DPG-Bench),这是一个包含 1K 个密集提示的高难度基准。大量实验表明,ELLA 在密集提示跟随方面优于最先进方法,特别是在涉及多样属性和关系的多个对象组合场景中。
引用
@article{arxiv.2403.05135,
title = {ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment},
author = {Xiwei Hu and Rui Wang and Yixiao Fang and Bin Fu and Pei Cheng and Gang Yu},
journal= {arXiv preprint arXiv:2403.05135},
year = {2024}
}
备注
Project Page: https://ella-diffusion.github.io/