廉价且快速:面向大语言模型的高效视觉-语言指令微调
计算机视觉与模式识别
2023-10-25 v3
摘要
近来,扩展大语言模型(LLMs)的多模态能力(例如视觉-语言(VL)学习)引起了越来越多的关注,这被视为通用人工智能的下一个里程碑。然而,现有方案成本高昂,不仅需优化过多参数,还需在 VL 指令微调前进行另一轮大规模预训练。本文提出一种新颖且可负担的 LLM 高效 VL 适配方案,称为混合模态适配(MMA)。MMA 不使用大型神经网络连接图像编码器与 LLM,而是采用轻量级模块(即适配器)来弥合 LLM 与 VL 任务之间的鸿沟,并实现图像与语言模型的联合优化。同时,MMA 配备了一种路由算法,帮助 LLM 在单模态与多模态指令间自动切换,且不损害其自然语言理解能力。为验证 MMA,我们将其应用于近期 LLM LLaMA,并将所得大型视觉-语言指令模型称为 LaVIN。为验证 MMA 与 LaVIN,我们在多模态科学问答与多模态对话两种设定下进行了大量实验。实验结果不仅表明 LaVIN 相较现有多模态 LLM 具有更具竞争力的性能与更优的训练效率,也证实了其作为通用聊天机器人的巨大潜力。更重要的是,LaVIN 的实际开销极低,例如仅用 1.4 个训练小时与 3.8M 可训练参数,极大印证了 MMA 的有效性。我们的项目发布于 https://luogen1996.github.io/lavin。
引用
@article{arxiv.2305.15023,
title = {Cheap and Quick: Efficient Vision-Language Instruction Tuning for Large Language Models},
author = {Gen Luo and Yiyi Zhou and Tianhe Ren and Shengxin Chen and Xiaoshuai Sun and Rongrong Ji},
journal= {arXiv preprint arXiv:2305.15023},
year = {2023}
}