中文

联合训练大型自回归多模态模型

机器学习 2023-09-29 v2 计算与语言 计算机视觉与模式识别

摘要

近年来,语言和文本到图像模型的大规模预训练进展彻底改变了机器学习领域。然而,将这两种模态整合到一个能够生成无缝多模态输出的单一鲁棒模型中,仍然是一项重大挑战。为弥补这一差距,我们提出了联合自回归混合(JAM)框架,这是一种系统性融合现有文本与图像生成模型的模块化方法。我们还引入了一种专门的、数据高效的指令微调策略,专为混合模态生成任务量身定制。我们最终经过指令微调的模型在生成高质量多模态输出方面展现出无与伦比的性能,并且是首个明确为此目的而设计的模型。

关键词

引用

@article{arxiv.2309.15564,
  title  = {Jointly Training Large Autoregressive Multimodal Models},
  author = {Emanuele Aiello and Lili Yu and Yixin Nie and Armen Aghajanyan and Barlas Oguz},
  journal= {arXiv preprint arXiv:2309.15564},
  year   = {2023}
}