COCO 是视觉指令微调所需的全部
计算机视觉与模式识别
2024-01-18 v1
摘要
多模态大型语言模型 (MLLM) 在人工智能领域日益突出。视觉指令微调 (IFT) 是将 MLLM 的输出与用户意图对齐的关键过程。高质量且多样化的指令跟随数据是这一微调过程的关键。最近的研究提出通过多方面方法构建视觉 IFT 数据集:利用基于规则的模板转换现有数据集、使用 GPT-4 重写标注,以及利用 GPT-4V 进行视觉数据集伪标注。LLaVA-1.5 采用了类似方法并构建了 LLaVA-mix-665k,这是当今最简单、使用最广泛且最有效的 IFT 数据集之一。值得注意的是,当使用此数据集进行适当微调时,MLLM 可以在多个基准测试中达到最先进的性能。然而,我们注意到,使用该数据集训练的模型往往难以在多轮对话中正确遵循用户指令。此外,传统的图像描述和 VQA 评估基准由于其封闭式评估结构,无法充分评估现代开放式生成 MLLM 的能力。这个问题并非 LLaVA-mix-665k 数据集独有,但可能是所有从图像描述或 VQA 源构建的 IFT 数据集的潜在问题,尽管程度可能有所不同。我们认为,具有多样化和高质量详细指令跟随标注的数据集对于 MLLM IFT 是必要且充分的。在这项工作中,我们建立了一个新的 IFT 数据集,图像源自 COCO 数据集,并包含更多样化的指令。我们的实验表明,当使用我们提出的数据集进行微调时,MLLM 在单轮和多轮对话设置下的开放式评估基准上取得了更好的性能。
引用
@article{arxiv.2401.08968,
title = {COCO is "ALL'' You Need for Visual Instruction Fine-tuning},
author = {Xiaotian Han and Yiqi Wang and Bohan Zhai and Quanzeng You and Hongxia Yang},
journal= {arXiv preprint arXiv:2401.08968},
year = {2024}
}