中文

LMFusion:为多模态生成任务适配预训练语言模型

计算与语言 2025-02-06 v4 人工智能 计算机视觉与模式识别 机器学习

摘要

我们提出LMFusion,一个赋予预训练文本-only大语言模型(LLM)多模态生成能力的框架,使其能够以任意序列理解和生成文本与图像。LMFusion利用现有的Llama-3权重对文本进行自回归处理,同时引入额外的平行Transformer模块用于处理基于扩散的图像。训练时,各模态的数据被路由到各自的专用模块:模态特定的前馈层、查询-键值投影和归一化层独立处理每个模态,而共享的自注意力层允许跨文本和图像特征的交互。通过冻结文本特定模块仅训练图像特定模块,LMFusion保留了文本-only LLM的语言能力,同时发展出强大的视觉理解和生成能力。与从头预训练多模态生成模型的方法相比,我们的实验表明,LMFusion在仅使用50%计算量的情况下,将图像理解提升20%,图像生成提升3.6%,同时保持Llama-3的语言能力。我们还展示了该框架能够适配现有的视觉-语言模型以具备多模态生成能力。总体而言,该框架不仅利用了文本-only LLM中现有的计算投资,还实现了语言能力和视觉能力的并行开发,为高效的多模态模型开发指明了前景方向。

关键词

引用

@article{arxiv.2412.15188,
  title  = {LMFusion: Adapting Pretrained Language Models for Multimodal Generation},
  author = {Weijia Shi and Xiaochuang Han and Chunting Zhou and Weixin Liang and Xi Victoria Lin and Luke Zettlemoyer and Lili Yu},
  journal= {arXiv preprint arXiv:2412.15188},
  year   = {2025}
}

备注

Name change: LlamaFusion to LMFusion