中文

FlexEControl:面向文本到图像生成的灵活高效多模态控制

计算机视觉与模式识别 2024-05-24 v2

摘要

可控文本到图像(T2I)扩散模型会在文本提示和其他模态语义输入(如边缘图)之间进行条件化。然而,当前可控T2I方法常面临效率和忠实性挑战,尤其是在来自相同或多样化模态的多个输入条件下。本文提出了一种新颖的灵活高效方法,FlexEControl,用于可控T2I生成。FlexEControl的核心是一种独特的权重分解策略,允许对各种输入类型进行简化集成。这一方法不仅提高了生成图像对控制的忠实性,还显著减少了通常与多模态条件化相关的计算开销。我们的方法相较于Uni-ControlNet,在可训练参数上减少41%,在内存使用上减少30%,同时数据效率提升一倍,并且可以在多种模态的多个输入条件下灵活生成图像。

关键词

引用

@article{arxiv.2405.04834,
  title  = {FlexEControl: Flexible and Efficient Multimodal Control for Text-to-Image Generation},
  author = {Xuehai He and Jian Zheng and Jacob Zhiyuan Fang and Robinson Piramuthu and Mohit Bansal and Vicente Ordonez and Gunnar A Sigurdsson and Nanyun Peng and Xin Eric Wang},
  journal= {arXiv preprint arXiv:2405.04834},
  year   = {2024}
}