中文

生成式视觉指令微调

计算机视觉与模式识别 2024-10-04 v2

摘要

我们提出使用自动生成的指令遵循数据来提升大型多模态模型的零样本能力,并额外支持生成和图像编辑任务。我们通过使用GPT-4V和现有的图像生成与编辑数据集,整理了一个新的多模态指令遵循集。利用该指令集和用于视觉理解任务的现有LLaVA-Finetune指令集,我们生成了GenLLaVA,一个生成式大型语言与视觉助手。GenLLaVA是通过一种结合三种大型预训练模型进行指令微调的策略构建的:用于语言建模的Mistral、用于图像-文本匹配的SigLIP和用于文本到图像生成的StableDiffusion。我们的模型展示了优于LLaVA的视觉理解能力,并且在与Unified-IO 2等原生多模态模型的比较中表现出竞争力,为通过有效重用现有多模态模型构建先进的通用视觉助手铺平了道路。我们开源了数据集、代码库和模型检查点,以促进该领域的进一步研究和应用。

关键词

引用

@article{arxiv.2406.11262,
  title  = {Generative Visual Instruction Tuning},
  author = {Jefferson Hernandez and Ruben Villegas and Vicente Ordonez},
  journal= {arXiv preprint arXiv:2406.11262},
  year   = {2024}
}

备注

Add more results using task tokens, expand the introduction and related work FIX: error in LLM-as-judge evaluation that was over-inflating the results