中文

MUMU: 从文本到图像数据引导的多模态图像生成

计算机视觉与模式识别 2024-09-13 v2 人工智能

摘要

我们训练一个模型,从交替包含文本和图像的多模态提示中生成图像,例如"a <picture of a man> man and his <picture of a dog> dog in an <picture of a cartoon> animated style." 我们通过从人工合成和公开可用文本-图像数据中的图像标题中提取与单词对应的语义丰富图像裁剪来引导多模态数据集。我们的模型 MUMU 由具备视觉-语言编码器和扩散解码器组成,在单个 8xH100 GPU 节点上进行训练。尽管仅在来自同一图像的裁剪上进行训练,MUMU 仍能学习将来自不同图像的输入组合成连贯的输出。例如,输入为真实人物和卡通图像,将输出以卡通风格呈现的同一人物;输入为站立姿态和摩托车,将输出人物骑乘摩托车。结果表明,MUMU 具备实现风格迁移和角色一致性等任务的泛化能力。我们的結果显示,使用多模态模型作为图像生成的通用控制器具有巨大的潜力。

关键词

引用

@article{arxiv.2406.18790,
  title  = {MUMU: Bootstrapping Multimodal Image Generation from Text-to-Image Data},
  author = {William Berman and Alexander Peysakhovich},
  journal= {arXiv preprint arXiv:2406.18790},
  year   = {2024}
}