LLaVA-Phi:基于小型语言模型的高效多模态助手
计算机视觉与模式识别
2024-02-23 v4 计算与语言
摘要
在本文中,我们介绍了 LLaVA- (LLaVA-Phi),这是一种高效的多模态助手,利用最近进展的小型语言模型 Phi-2 来促进多模态对话。LLaVA-Phi 标志着紧凑多模态模型领域的一个显著进步。它表明,即使参数量少至 2.7B 的较小语言模型,只要使用高质量语料库进行训练,也能有效地参与整合文本和视觉元素的复杂对话。我们的模型在涵盖视觉理解、推理和基于知识的感知的公开基准测试中表现出色。除了在多模态对话任务中的卓越表现外,我们的模型还为时间敏感环境和需要实时交互的系统(如具身智能体)的应用开辟了新途径。它突显了较小语言模型在保持更高资源效率的同时,实现复杂级别理解和交互的潜力。该项目可在 {https://github.com/zhuyiche/llava-phi} 获取。
引用
@article{arxiv.2401.02330,
title = {LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model},
author = {Yichen Zhu and Minjie Zhu and Ning Liu and Zhicai Ou and Xiaofeng Mou and Jian Tang},
journal= {arXiv preprint arXiv:2401.02330},
year = {2024}
}
备注
The datasets were incomplete as they did not include all the necessary copyrights