视觉指令微调
计算机视觉与模式识别
2023-12-14 v2 人工智能
计算与语言
机器学习
摘要
利用机器生成的指令遵循数据对大语言模型(LLM)进行指令微调,已提升其在新任务上的零样本能力,但该思路在多模态领域较少被探索。本文中,我们首次尝试仅用语言模型 GPT-4 生成多模态语言-图像指令遵循数据。通过在此类生成数据上指令微调,我们引入 LLaVA:大型语言与视觉助手(Large Language and Vision Assistant),一种端到端训练的大型多模态模型,连接视觉编码器与 LLM 以用于通用视觉与语言理解。我们的早期实验表明,LLaVA 展现出令人印象深刻的多模态对话能力,有时在未见图像/指令上表现出多模态 GPT-4 的行为,并在合成多模态指令遵循数据集上相较 GPT-4 取得 85.1% 的相对分数。当在 Science QA 上微调时,LLaVA 与 GPT-4 的协同达到 92.53% 的新最先进准确率。我们公开了 GPT-4 生成的视觉指令微调数据、我们的模型与代码库。
引用
@article{arxiv.2304.08485,
title = {Visual Instruction Tuning},
author = {Haotian Liu and Chunyuan Li and Qingyang Wu and Yong Jae Lee},
journal= {arXiv preprint arXiv:2304.08485},
year = {2023}
}
备注
NeurIPS 2023 Oral; project page: https://llava-vl.github.io/