中文

MMInstruct:一个拥有广泛多样性的高质量多模态指令调优数据集

计算机视觉与模式识别 2024-12-17 v2

摘要

尽管视觉语言监督微调在增强视觉大语言模型(Vision Large Language Models, VLLMs)性能方面效果显著,但现有视觉指令调优数据集存在以下局限性:(1) 指令注释质量:尽管现有VLLMs表现出色,但由这些先进VLLMs生成的指令可能仍存在不准确问题,如幻觉。(2) 指令与图像多样性:指令类型范围有限且图像数据缺乏多样性,可能影响模型生成多样化且接近真实场景输出的能力。为此,我们构建了一个高质量、多样化的视觉指令调优数据集MMInstruct,包含来自24个领域的97.3万条指令。数据集包含四种指令类型:判断型、多选型、长视觉问答和短视觉问答。为构建MMInstruct,我们提出了一种指令生成数据引擎,利用GPT-4V、GPT-3.5和人工纠正。我们的指令生成引擎实现了半自动、低成本、跨领域的指令生成,成本仅为人工构造的1/6。通过大量实验验证和消融实验,我们展示了MMInstruct显著提升了VLLMs的性能,例如在10个基准测试中实现了新的状态突破性能。代码和数据可在https://github.com/yuecao0119/MMInstruct获取。

关键词

引用

@article{arxiv.2407.15838,
  title  = {MMInstruct: A High-Quality Multi-Modal Instruction Tuning Dataset with Extensive Diversity},
  author = {Yangzhou Liu and Yue Cao and Zhangwei Gao and Weiyun Wang and Zhe Chen and Wenhai Wang and Hao Tian and Lewei Lu and Xizhou Zhu and Tong Lu and Yu Qiao and Jifeng Dai},
  journal= {arXiv preprint arXiv:2407.15838},
  year   = {2024}
}

备注

18 pages, 8 figures, technical report