训练具有多模态输入的 GPT4 风格语言模型的关键因素
计算机视觉与模式识别
2023-08-01 v2 计算与语言
摘要
近期 GPT4 等大型语言模型(LLMs)展现出在给定图像后遵循开放式指令的卓越多模态能力。然而,这些模型的性能严重依赖于网络结构、训练数据和训练策略等设计选择,而这些选择在文献中尚未被充分讨论,使得该领域的进展难以量化。为解决这个问题,本文对训练此类模型进行了系统而全面的研究,涵盖定量与定性分析。我们实现了超过 20 个受控设置的变体。具体而言,在网络结构方面,我们比较了不同的 LLM 主干与模型设计;在训练数据方面,我们考察了数据与采样策略的影响;在指令方面,我们探究了多样化提示对训练模型指令遵循能力的影响;在基准方面,我们贡献了据我们所知首个通过众包构建的、包含图像与视频任务的全面评估集。基于我们的发现,我们提出 Lynx,与现有开源 GPT4 风格模型相比,其在保持最佳多模态生成能力的同时实现了最准确的多模态理解。
引用
@article{arxiv.2307.02469,
title = {What Matters in Training a GPT4-Style Language Model with Multimodal Inputs?},
author = {Yan Zeng and Hanbo Zhang and Jiani Zheng and Jiangnan Xia and Guoqiang Wei and Yang Wei and Yuchen Zhang and Tao Kong},
journal= {arXiv preprint arXiv:2307.02469},
year = {2023}
}
备注
32 pages