中文

多模态 LLM 预训练的方法、分析与见解

计算机视觉与模式识别 2024-04-22 v4 计算与语言 机器学习

摘要

本文讨论了构建高性能多模态大型语言模型(MLLM)的方法。特别是,我们研究了各种架构组件和数据选择的重要性。通过对图像编码器、视觉语言连接器以及各种预训练数据选择进行仔细且全面的消融实验,我们确定了几个关键的设计教训。例如,我们展示了对于大规模多模态预训练,使用精心混合的图像-文本、交错图像文本和文本-only 数据对于在多个基准上实现最先进(SOTA)的few-shot 结果至关重要,与其他已发布的预训练结果相比。进一步地,我们表明图像编码器与图像分辨率以及图像 token 数量对模型影响巨大,而视觉语言连接器的设计则相对不重要。通过放大所提出的配方,我们构建了MM1,一系列最高可达300亿参数的多模态模型,包括密集模型和混合专家(MoE)变体,在预训练指标上达到SOTA,在各种 established 多模态基准上进行监督微调后实现竞争性能。由于大规模预训练,MM1 具备诸多吸引人的特性,例如增强的情境学习能力和多图像推理能力,使其能够实现 few-shot 链式思考提示。

关键词

引用

@article{arxiv.2403.09611,
  title  = {MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training},
  author = {Brandon McKinzie and Zhe Gan and Jean-Philippe Fauconnier and Sam Dodge and Bowen Zhang and Philipp Dufter and Dhruti Shah and Xianzhi Du and Futang Peng and Floris Weers and Anton Belyi and Haotian Zhang and Karanjeet Singh and Doug Kang and Ankur Jain and Hongyu Hè and Max Schwarzer and Tom Gunter and Xiang Kong and Aonan Zhang and Jianyu Wang and Chong Wang and Nan Du and Tao Lei and Sam Wiseman and Guoli Yin and Mark Lee and Zirui Wang and Ruoming Pang and Peter Grasch and Alexander Toshev and Yinfei Yang},
  journal= {arXiv preprint arXiv:2403.09611},
  year   = {2024}
}