中文

MoMA:用于快速个性化图像生成的多模态 LLM 适配器

计算机视觉与模式识别 2024-04-09 v1

摘要

本文提出 MoMA:一个具备灵活零样本能力的开放词表、免训练个性化图像模型。随着基础文本到图像模型的快速演进,对稳健的图像到图像转换的需求日益增长。为满足这一需求,MoMA 专注于主体驱动的个性化图像生成。利用开源的多模态大语言模型(MLLM),我们训练 MoMA 同时充当特征提取器和生成器的双重角色。该方法有效地将参考图像与文本提示信息协同起来,以产生有价值的图像特征,从而促进图像扩散模型的工作。为更好地利用生成的特征,我们进一步引入了一种新颖的自注意力快捷方法,将图像特征高效地传输给图像扩散模型,提升了生成图像中目标对象的相似度。值得注意的是,作为一个免调优的即插即用模块,我们的模型仅需单张参考图像,在生成具有高细节保真度、增强的身份保持性和提示忠实度的图像方面优于现有方法。我们的工作是开源的,从而为这些技术进步提供普及访问。

关键词

引用

@article{arxiv.2404.05674,
  title  = {MoMA: Multimodal LLM Adapter for Fast Personalized Image Generation},
  author = {Kunpeng Song and Yizhe Zhu and Bingchen Liu and Qing Yan and Ahmed Elgammal and Xiao Yang},
  journal= {arXiv preprint arXiv:2404.05674},
  year   = {2024}
}