TinyGPT-V:基于小骨干网络的高效多模态大语言模型
计算机视觉与模式识别
2024-06-24 v3 计算与语言
摘要
近年来,诸如 GPT-4V 等多模态大语言模型 (MLLMs) 展现了显著的进步,在各种视觉-语言任务中表现出色。尽管它们功能强大,但此类模型的闭源性质和计算需求限制了其可访问性和适用性。本研究引入了 TinyGPT-V,一种新型开源 MLLM,旨在跨各种视觉-语言任务(包括图像描述生成 (IC) 和视觉问答 (VQA))实现高效训练和推理。利用紧凑而强大的架构,TinyGPT-V 将 Phi-2 语言模型与预训练视觉编码器集成,利用独特的映射模块进行视觉和语言信息融合。通过针对小骨干网络优化的训练方案并采用多样化数据集融合,TinyGPT-V 所需的计算资源显著降低——训练仅需 24GB,推理仅需 8GB,且不牺牲性能。我们的实验表明,TinyGPT-V 凭借其 28 亿参数的语言模型,在 VQA 和图像推理任务中取得了与其较大同类模型相当的结果,同时通过创新的量化技术,独特地适合于在资源受限的设备上部署。这项工作不仅为更易获取和高效的 MLLM 铺平了道路,也突显了更小、优化后的模型在弥合实际应用中高性能与计算效率之间差距的潜力。此外,本文提出了一种使用较小骨干网络的多模态大语言模型新方法。我们的代码和训练权重可在补充材料中获取。
引用
@article{arxiv.2312.16862,
title = {TinyGPT-V: Efficient Multimodal Large Language Model via Small Backbones},
author = {Zhengqing Yuan and Zhaoxu Li and Weiran Huang and Yanfang Ye and Lichao Sun},
journal= {arXiv preprint arXiv:2312.16862},
year = {2024}
}
备注
Accepted by ICML workshop 2024