通过视觉指令微调改进基线
计算机视觉与模式识别
2024-05-17 v2 人工智能
计算与语言
机器学习
摘要
大型多模态模型(LMM)最近在视觉指令微调方面显示出令人鼓舞的进展。在本笔记中,我们展示 LLaVA 中的全连接视觉-语言跨模态连接器出奇地强大且数据高效。通过对 LLaVA 的简单修改,即使用带有 MLP 投影的 CLIP-ViT-L-336px,并添加面向学术任务的 VQA 数据及简单响应格式化提示,我们建立了更强的基线,在 11 个基准上实现了最先进水平(state-of-the-art)。我们最终的 13B 检查点仅使用 120 万公开可用数据,并在单个 8-A100 节点上约 1 天完成全部训练。我们希望这能使最先进的 LMM 研究更易获取。代码和模型将公开可用。
引用
@article{arxiv.2310.03744,
title = {Improved Baselines with Visual Instruction Tuning},
author = {Haotian Liu and Chunyuan Li and Yuheng Li and Yong Jae Lee},
journal= {arXiv preprint arXiv:2310.03744},
year = {2024}
}
备注
Camera ready, CVPR 2024 (highlight). LLaVA project page: https://llava-vl.github.io