LLaMA-Adapter V2:参数高效视觉指令模型
计算机视觉与模式识别
2023-05-01 v1 人工智能
计算与语言
机器学习
多媒体
摘要
如何高效地将大语言模型(LLMs)转化为指令跟随器近期是热门研究方向,而训练 LLM 进行多模态推理仍较少被探索。尽管近期的 LLaMA-Adapter 展示了用 LLM 处理视觉输入的潜力,其仍不能很好地泛化到开放式视觉指令,且落后于 GPT-4。本文中,我们提出 LLaMA-Adapter V2,一种参数高效的视觉指令模型。具体而言,我们首先通过解锁更多可学习参数(如 norm、bias 与 scale)来增强 LLaMA-Adapter,这些参数将指令跟随能力分布于整个 LLaMA 模型及适配器之外。其次,我们提出早期融合策略,仅将视觉 token 送入早期 LLM 层,有助于更好的视觉知识融入。第三,通过优化不相交的可学习参数组,引入图像-文本对与指令跟随数据的联合训练范式。该策略有效缓解了图像-文本对齐与指令跟随两项任务间的干扰,并以仅小规模图像-文本与指令数据集实现了强多模态推理。推理时,我们将额外专家模型(如描述生成/OCR 系统)整合进 LLaMA-Adapter,以在不产生训练成本下进一步增强其图像理解能力。相较于原始 LLaMA-Adapter,我们的 LLaMA-Adapter V2 仅需在 LLaMA 上引入 14M 参数即可执行开放式多模态指令。新设计的框架也展现出更强的纯语言指令跟随能力,甚至在聊天交互中表现出色。我们的代码与模型见于 https://github.com/ZrrSkywalker/LLaMA-Adapter。
引用
@article{arxiv.2304.15010,
title = {LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model},
author = {Peng Gao and Jiaming Han and Renrui Zhang and Ziyi Lin and Shijie Geng and Aojun Zhou and Wei Zhang and Pan Lu and Conghui He and Xiangyu Yue and Hongsheng Li and Yu Qiao},
journal= {arXiv preprint arXiv:2304.15010},
year = {2023}
}
备注
Code and models are available at https://github.com/ZrrSkywalker/LLaMA-Adapter