X2I:通过注意力蒸馏将多模态理解无缝集成至扩散Transformer
计算机视觉与模式识别
2025-08-12 v3
摘要
文本到图像(T2I)模型因其生成高度逼真图像的能力而闻名,而多模态大语言模型(MLLM)则因其在理解与融合多种模态方面的卓越能力而备受赞誉。然而,目前尚无直接且高效的框架能将MLLM的多模态理解能力迁移至T2I模型,以使其能够理解多模态输入。本文提出X2I框架,赋予扩散Transformer(DiT)模型理解多种模态的能力,包括多语言文本、截图文档、图像、视频和音频。X2I仅使用10万词规模的英文语料库与160 GPU小时进行训练。基于DiT教师模型,我们采用创新的蒸馏方法提取教师模型的推理能力,并设计轻量级AlignNet结构作为中间桥梁。与教师模型相比,X2I的性能下降幅度小于1%,同时获得了多种多模态理解能力,包括多语言到图像、图像到图像、图文到图像、视频到图像、音频到图像,以及利用创造性融合增强图像。此外,它适用于图文到图像生成场景下的LoRA训练,填补了业界在该领域的空白。我们进一步设计了简单的LightControl以增强指令式图像编辑的保真度。最后,大量实验证明了X2I的有效性、高效性、多功能性和可迁移性。X2I的开源代码与检查点可在以下链接获取:https://github.com/OPPO-Mente-Lab/X2I。
引用
@article{arxiv.2503.06134,
title = {X2I: Seamless Integration of Multimodal Understanding into Diffusion Transformer via Attention Distillation},
author = {Jian Ma and Qirong Peng and Xu Guo and Chen Chen and Haonan Lu and Zhenyu Yang},
journal= {arXiv preprint arXiv:2503.06134},
year = {2025}
}
备注
Accepted to ICCV 2025