Imp:面向移动设备的高能力大型多模态模型
计算机视觉与模式识别
2024-05-31 v2 计算与语言
摘要
通过利用大型语言模型(LLM)的能力,近期的大型多模态模型(Large Multimodal Models, LMM)在开放世界多模态理解中展现出了卓越的通用性。然而,它们通常参数量大且计算密集,从而阻碍了其在资源受限场景中的适用性。为此,相继提出了几种轻量级 LMM,以在受限规模(例如 3B)下最大化能力。尽管这些方法取得了令人鼓舞的结果,但其中大多数仅关注设计空间的一两个方面,且影响模型能力的关键设计选择尚未得到彻底研究。在本文中,我们从模型架构、训练策略和训练数据等方面对轻量级 LMM 进行了系统研究。基于我们的发现,我们获得了 Imp——一个在 2B-4B 规模上具有高能力的 LMM 家族。值得注意的是,我们的 Imp-3B 模型稳定地优于所有现有的同等规模的轻量级 LMM,甚至超越了 13B 规模的最先进 LMM。借助低比特量化和分辨率降低技术,我们的 Imp 模型可部署于 Qualcomm Snapdragon 8Gen3 移动芯片上,实现约 13 tokens/s 的高推理速度。
引用
@article{arxiv.2405.12107,
title = {Imp: Highly Capable Large Multimodal Models for Mobile Devices},
author = {Zhenwei Shao and Zhou Yu and Jun Yu and Xuecheng Ouyang and Lihao Zheng and Zhenbiao Gai and Mingyang Wang and Jiajun Ding},
journal= {arXiv preprint arXiv:2405.12107},
year = {2024}
}
备注
fix some typos and correct a few number in the tables