中文

MM-Instruct:用于大型多模态模型对齐的生成视觉指令

计算机视觉与模式识别 2024-07-01 v1 人工智能 计算与语言 机器学习

摘要

本文介绍了 MM-Instruct,一个大规模多样且高质量的视觉指令数据集,旨在增强大型多模态模型(LMM)的指令遵循能力。虽然现有的视觉指令数据集常聚焦于问答任务,但难以泛化到更广泛的应用场景,如创意写作、摘要或图像分析。为克服这些限制,我们提出了一种新颖的 MM-Instruct 构建方法,利用现有大型语言模型(LLM)的强大的指令遵循能力,从大规模但传统的图像描述数据集中生成新颖的视觉指令数据。MM-Instruct 首先利用 ChatGPT 从少量初始指令通过增强和摘要生成多样化指令,然后将这些指令与图像匹配,并使用开源大型语言模型(LLM)为指令-图像对生成连贯的答案。在整个答案生成过程中,LLM 依据图像的详细文本描述进行 grounding,以确保指令数据的对齐。此外,我们还引入了一个基于生成指令数据的数据集,以评估现有 LMM 的指令遵循能力。我们通过在生成的数据上训练 LLaVA-1.5 模型(称为 LLaVA-Instruct),展示了 MM-Instruct 的有效性,该模型在指令遵循能力上显著优于 LLaVA-1.5 模型。 MM-Instruct 数据集、基准测试和预训练模型均可在 https://github.com/jihaonew/MM-Instruct 上获取。

关键词

引用

@article{arxiv.2406.19736,
  title  = {MM-Instruct: Generated Visual Instructions for Large Multimodal Model Alignment},
  author = {Jihao Liu and Xin Huang and Jinliang Zheng and Boxiao Liu and Jia Wang and Osamu Yoshie and Yu Liu and Hongsheng Li},
  journal= {arXiv preprint arXiv:2406.19736},
  year   = {2024}
}

备注

Dataset and models are available at https://github.com/jihaonew/MM-Instruct