中文

Mipha:基于小型语言模型的多模态助手的全面重构

计算机视觉与模式识别 2024-03-26 v4 计算与语言

摘要

多模态大语言模型(MLLMs)在视觉理解与推理相关任务中展现了出色的能力。然而,由于在训练和推理阶段均存在极高的计算需求,其广泛应用面临障碍,将其使用限制在研究和用户社区中的少数群体。在本文中,我们研究了多模态小型语言模型(MSLMs)的设计方面,并提出了一种名为Mipha的高效多模态助手,旨在视觉表示、语言模型和优化策略等各个方面创建协同效应。我们表明,在不增加训练数据量的情况下,我们的Mipha-3B在多个基准测试中优于state-of-the-art的大型MLLMs,尤其是LLaVA-1.5-13B。通过详细讨论,我们为开发能够匹敌MLLMs能力的强大MSLMs提供了见解和指导方针。我们的代码可在https://github.com/zhuyiche/llava-phi获取。

关键词

引用

@article{arxiv.2403.06199,
  title  = {Mipha: A Comprehensive Overhaul of Multimodal Assistant with Small Language Models},
  author = {Minjie Zhu and Yichen Zhu and Xin Liu and Ning Liu and Zhiyuan Xu and Chaomin Shen and Yaxin Peng and Zhicai Ou and Feifei Feng and Jian Tang},
  journal= {arXiv preprint arXiv:2403.06199},
  year   = {2024}
}