中文

大型语言模型与多模态模型的集成:SoupLM

人工智能 2024-07-12 v1

摘要

训练大型语言模型(LLM)和多模态 LLM 需要巨大的计算资源,而现有的公开 LLM 通常是在多样化、私人精选的数据集上进行预训练的,这些数据集涵盖各种任务。例如,LLaMA、Vicuna 和 LLaVA 是三个不同的 LLM 变体,它们使用 LLaMA 基础模型,但采用截然不同的训练配方、任务和数据模态。这些 LLM 变体的训练成本和复杂度会迅速增加。本研究提出使用一种汤(soup)策略,将这些 LLM 变体组装成一个在成本效益方面更为出色的多模态 LLM(SoupLM)。高效地将这些 LLM 变体组合并能将不同领域和数据模态中训练得到的知识与专长整合到一个模型中(例如,来自 Vicuna 用户共享对话的聊天专长,来自视觉-语言数据的 LLaVA 的视觉能力),从而避免在多个领域上进行重复训练的计算成本。我们提出了一系列汤策略,以系统性地衡量各种配置下的性能提升,并探讨汤在插值空间中不同基模型的行为。

关键词

引用

@article{arxiv.2407.08196,
  title  = {SoupLM: Model Integration in Large Language and Multi-Modal Models},
  author = {Yue Bai and Zichen Zhang and Jiasen Lu and Yun Fu},
  journal= {arXiv preprint arXiv:2407.08196},
  year   = {2024}
}