指令微调大型多模态模型缩放的实证研究
计算机视觉与模式识别
2023-09-19 v1 计算与语言
摘要
视觉指令微调近期在 LLaVA 和 MiniGPT-4 等开源大型多模态模型(LMM)上取得了令人鼓舞的进展。然而,大多数现有开源 LMM 研究均使用参数量 13B 或更小的模型进行。本文对将 LLaVA 扩展至 33B 和 65B/70B 进行了实证研究,并分享了我们在图像分辨率、数据混合以及 LoRA/QLoRA 等参数高效训练方法探索中的发现。这些方面通过其在真实场景任务中对多模态与语言能力的影响进行评估。我们发现,缩放 LMM 能持续提升模型性能并改善语言能力,且 LMM 的 LoRA/QLoRA 微调性能与全模型微调相当。此外,研究强调了更高图像分辨率和混合多模态-语言数据对提升 LMM 性能的重要性,并且视觉指令微调有时能改善 LMM 的纯语言能力。我们希望本研究能使更大规模的最先进 LMM 研究更易获取,从而有助于为未来研究建立更强的基线。代码与检查点将公开。
引用
@article{arxiv.2309.09958,
title = {An Empirical Study of Scaling Instruct-Tuned Large Multimodal Models},
author = {Yadong Lu and Chunyuan Li and Haotian Liu and Jianwei Yang and Jianfeng Gao and Yelong Shen},
journal= {arXiv preprint arXiv:2309.09958},
year = {2023}
}
备注
Released at LLaVA Model Zoo: https://github.com/haotian-liu/LLaVA/blob/main/docs/MODEL_ZOO.md