LLaVA-Gemma:利用紧凑语言模型加速多模态基础模型
计算与语言
2024-06-12 v2 人工智能
摘要
我们使用流行的LLaVA框架和最近发布的Gemma系列大语言模型(LLM)训练了一套多模态基础模型(MMFM)。特别值得关注的是2B参数的Gemma模型,它为构建能力强大的小型MMFM提供了机会。与这一领域其他论文的发现一致,我们测试了消融三个设计特征的效果:预训练连接器、使用更强大的图像骨干网络、以及增加语言骨干网络的规模。由此产生的模型,我们称之为LLaVA-Gemma,在一系列评估中表现出中等性能,但未能超越当前同等规模的最先进模型。对性能的进一步分析显示出混合效应:跳过预训练往往会降低性能,更大的视觉模型有时会提高性能,而增加语言模型规模的效果不一致。我们公开发布了LLaVA-Gemma模型的训练配方、代码和权重。
引用
@article{arxiv.2404.01331,
title = {LLaVA-Gemma: Accelerating Multimodal Foundation Models with a Compact Language Model},
author = {Musashi Hinck and Matthew L. Olson and David Cobbley and Shao-Yen Tseng and Vasudev Lal},
journal= {arXiv preprint arXiv:2404.01331},
year = {2024}
}
备注
CVPR 2024, MMFM workshop. Authors 1 and 2 contributed equally. Models available at https://huggingface.co/intel/llava-gemma-2b/ and https://huggingface.co/intel/llava-gemma-7b/ Training code at https://github.com/IntelLabs/multimodal_cognitive_ai/tree/main/LLaVA-Gemma