中文

视觉指令微调

计算机视觉与模式识别 2023-12-14 v2 人工智能 计算与语言 机器学习

摘要

利用机器生成的指令遵循数据对大语言模型(LLM)进行指令微调,已提升其在新任务上的零样本能力,但该思路在多模态领域较少被探索。本文中,我们首次尝试仅用语言模型 GPT-4 生成多模态语言-图像指令遵循数据。通过在此类生成数据上指令微调,我们引入 LLaVA:大型语言与视觉助手(Large Language and Vision Assistant),一种端到端训练的大型多模态模型,连接视觉编码器与 LLM 以用于通用视觉与语言理解。我们的早期实验表明,LLaVA 展现出令人印象深刻的多模态对话能力,有时在未见图像/指令上表现出多模态 GPT-4 的行为,并在合成多模态指令遵循数据集上相较 GPT-4 取得 85.1% 的相对分数。当在 Science QA 上微调时,LLaVA 与 GPT-4 的协同达到 92.53% 的新最先进准确率。我们公开了 GPT-4 生成的视觉指令微调数据、我们的模型与代码库。

关键词

引用

@article{arxiv.2304.08485,
  title  = {Visual Instruction Tuning},
  author = {Haotian Liu and Chunyuan Li and Qingyang Wu and Yong Jae Lee},
  journal= {arXiv preprint arXiv:2304.08485},
  year   = {2023}
}

备注

NeurIPS 2023 Oral; project page: https://llava-vl.github.io/