SVIT:扩展视觉指令微调规模
计算机视觉与模式识别
2023-12-29 v3
摘要
得益于基础模型的出现,大语言与视觉模型被集成以获得视觉描述、问答等多模态能力。尽管现有多模态模型展现出令人印象深刻的视觉理解与推理性能,但由于高质量指令微调数据的稀缺,其局限仍很大程度上未被充分探索。为突破多模态能力的极限,我们通过构建包含 420 万视觉指令微调数据的数据集来扩展视觉指令微调(SVIT)规模,其中包括 160 万对话问答(QA)对、160 万复杂推理 QA 对、100 万指代 QA 对以及 106K 详细图像描述。除规模外,所提数据集还以高质量和丰富多样性为特征,由利用图像丰富人工标注提示 GPT-4 生成。我们还提出一种新的数据配方以选取具有更好多样性和均衡性的子集,从而激发模型的优越能力。大量实验验证,在所提数据集上训练的 SVIT-v1.5 在流行基准上优于最先进的多模态大语言模型(Multimodal Large Language Models)。数据和代码公开于 https://github.com/BAAI-DCAI/Visual-Instruction-Tuning。
引用
@article{arxiv.2307.04087,
title = {SVIT: Scaling up Visual Instruction Tuning},
author = {Bo Zhao and Boya Wu and Muyang He and Tiejun Huang},
journal= {arXiv preprint arXiv:2307.04087},
year = {2023}
}