EMMA:您的文本到图像扩散模型可以秘密接受多模态提示
计算机视觉与模式识别
2024-06-14 v1
摘要
图像生成的最新进展使得能够根据文本条件创建高质量图像。然而,当面对多模态条件(例如文本结合参考外观)时,现有方法难以有效平衡多个条件,通常表现出对一种模态的偏好。为了应对这一挑战,我们引入了EMMA,一种新颖的图像生成模型,它接受基于最先进的文本到图像(T2I)扩散模型ELLA构建的多模态提示。EMMA通过一种创新的多模态特征连接器设计,将额外的模态与文本无缝结合以指导图像生成,该设计使用特殊的注意力机制有效地整合了文本和补充模态信息。通过冻结原始T2I扩散模型中的所有参数并仅调整一些附加层,我们发现了一个有趣的现象:预训练的T2I扩散模型可以秘密地接受多模态提示。这一有趣的特性便于轻松适应不同的现有框架,使EMMA成为生成个性化和上下文感知图像甚至视频的灵活且有效的工具。此外,我们引入了一种策略来组装学习到的EMMA模块,以同时基于多种模态条件生成图像,从而消除了使用混合多模态提示进行额外训练的需要。大量实验证明了EMMA在保持生成图像的高保真度和细节方面的有效性,展示了其作为先进多模态条件图像生成任务的稳健解决方案的潜力。
引用
@article{arxiv.2406.09162,
title = {EMMA: Your Text-to-Image Diffusion Model Can Secretly Accept Multi-Modal Prompts},
author = {Yucheng Han and Rui Wang and Chi Zhang and Juntao Hu and Pei Cheng and Bin Fu and Hanwang Zhang},
journal= {arXiv preprint arXiv:2406.09162},
year = {2024}
}
备注
https://tencentqqgylab.github.io/EMMA