FlexEControl:面向文本到图像生成的灵活高效多模态控制
计算机视觉与模式识别
2024-05-24 v2
摘要
可控文本到图像(T2I)扩散模型会在文本提示和其他模态语义输入(如边缘图)之间进行条件化。然而,当前可控T2I方法常面临效率和忠实性挑战,尤其是在来自相同或多样化模态的多个输入条件下。本文提出了一种新颖的灵活高效方法,FlexEControl,用于可控T2I生成。FlexEControl的核心是一种独特的权重分解策略,允许对各种输入类型进行简化集成。这一方法不仅提高了生成图像对控制的忠实性,还显著减少了通常与多模态条件化相关的计算开销。我们的方法相较于Uni-ControlNet,在可训练参数上减少41%,在内存使用上减少30%,同时数据效率提升一倍,并且可以在多种模态的多个输入条件下灵活生成图像。
引用
@article{arxiv.2405.04834,
title = {FlexEControl: Flexible and Efficient Multimodal Control for Text-to-Image Generation},
author = {Xuehai He and Jian Zheng and Jacob Zhiyuan Fang and Robinson Piramuthu and Mohit Bansal and Vicente Ordonez and Gunnar A Sigurdsson and Nanyun Peng and Xin Eric Wang},
journal= {arXiv preprint arXiv:2405.04834},
year = {2024}
}