中文

通过视觉指令微调改进基线

计算机视觉与模式识别 2024-05-17 v2 人工智能 计算与语言 机器学习

摘要

大型多模态模型(LMM)最近在视觉指令微调方面显示出令人鼓舞的进展。在本笔记中,我们展示 LLaVA 中的全连接视觉-语言跨模态连接器出奇地强大且数据高效。通过对 LLaVA 的简单修改,即使用带有 MLP 投影的 CLIP-ViT-L-336px,并添加面向学术任务的 VQA 数据及简单响应格式化提示,我们建立了更强的基线,在 11 个基准上实现了最先进水平(state-of-the-art)。我们最终的 13B 检查点仅使用 120 万公开可用数据,并在单个 8-A100 节点上约 1 天完成全部训练。我们希望这能使最先进的 LMM 研究更易获取。代码和模型将公开可用。

关键词

引用

@article{arxiv.2310.03744,
  title  = {Improved Baselines with Visual Instruction Tuning},
  author = {Haotian Liu and Chunyuan Li and Yuheng Li and Yong Jae Lee},
  journal= {arXiv preprint arXiv:2310.03744},
  year   = {2024}
}

备注

Camera ready, CVPR 2024 (highlight). LLaVA project page: https://llava-vl.github.io