中文

TinyLLaVA:小规模大型多模态模型框架

机器学习 2024-02-23 v1 计算与语言

摘要

我们提出了 TinyLLaVA 框架,为设计和分析小规模大型多模态模型 (LMMs) 提供了统一的视角。我们实证研究了不同视觉编码器、连接模块、语言模型、训练数据和训练策略的效果。大量实验表明,结合更高质量的数据和更优的训练策略,较小的 LMMs 能够持续达到与较大 LMMs 相当的性能。在该框架下,我们训练了一系列小规模 LMMs。我们最好的模型 TinyLLaVA-3.1B 在整体性能上优于现有的 7B 模型,如 LLaVA-1.5 和 Qwen-VL。我们希望我们的发现能作为未来在数据缩放、训练设置和模型选择方面研究的基线。我们的模型权重和代码将公开。

关键词

引用

@article{arxiv.2402.14289,
  title  = {TinyLLaVA: A Framework of Small-scale Large Multimodal Models},
  author = {Baichuan Zhou and Ying Hu and Xi Weng and Junlong Jia and Jie Luo and Xien Liu and Ji Wu and Lei Huang},
  journal= {arXiv preprint arXiv:2402.14289},
  year   = {2024}
}

备注

Our model weights and codes will be made public at https://github.com/DLCV-BUAA/TinyLLaVABench