中文

EasyGen:利用BiDiffuser与LLM简化多模态生成

人工智能 2024-05-20 v3 计算与语言 计算机视觉与模式识别

摘要

我们提出EasyGen,一种通过利用扩散模型与大型语言模型(LLM)的能力来增强多模态理解与生成的高效模型。与现有主要依赖CLIP或ImageBind等编码器且需要大量训练数据来桥接模态的多模态模型不同,EasyGen借助双向条件扩散模型BiDiffuser来促进更高效的模态交互。EasyGen通过训练连接BiDiffuser与LLM的投影层实现文本生成,并通过训练适配器将LLM的文本空间与BiDiffuser的图像空间对齐来实现图像生成。全面的定量与定性实验表明,EasyGen在数据高效训练、高质量图像生成及可扩展性方面表现优异,有效应对了多模态生成中的挑战。源代码发布于https://github.com/zxy556677/EasyGen。

关键词

引用

@article{arxiv.2310.08949,
  title  = {EasyGen: Easing Multimodal Generation with BiDiffuser and LLMs},
  author = {Xiangyu Zhao and Bo Liu and Qijiong Liu and Guangyuan Shi and Xiao-Ming Wu},
  journal= {arXiv preprint arXiv:2310.08949},
  year   = {2024}
}

备注

Accepted by ACL 2024, main conference