M$^3$IT:面向多模态多语言指令微调的大规模数据集
计算机视觉与模式识别
2023-06-09 v2 计算与语言
摘要
指令微调已显著推进了诸如 ChatGPT 等大语言模型(LLMs)的发展,使其能跨多样任务与人类指令对齐。然而,由于高质量指令数据集的匮乏,开放视觉-语言模型(VLMs)的进展受限。为应对此挑战并推动视觉-语言领域研究,我们引入了多模态多语言指令微调(MIT)数据集,旨在优化 VLM 与人类指令的对齐。我们的 MIT 数据集包含 40 个精心策划的数据集,涵盖 240 万实例与 400 条人工编写的任务指令,并被重新格式化为视觉到文本结构。关键任务经先进翻译系统译为 80 种语言,以确保更广的可及性。MIT 在任务覆盖、指令数量与实例规模上均超越先前数据集。此外,我们开发了 Ying-VLM,一个基于 MIT 数据集训练的 VLM 模型,展示了其回答需世界知识的复杂问题、泛化至未见视频任务以及理解中文未见指令的潜力。我们已开源该数据集以鼓励进一步研究。
引用
@article{arxiv.2306.04387,
title = {M$^3$IT: A Large-Scale Dataset towards Multi-Modal Multilingual Instruction Tuning},
author = {Lei Li and Yuwei Yin and Shicheng Li and Liang Chen and Peiyi Wang and Shuhuai Ren and Mukai Li and Yazheng Yang and Jingjing Xu and Xu Sun and Lingpeng Kong and Qi Liu},
journal= {arXiv preprint arXiv:2306.04387},
year = {2023}
}
备注
Fix dataset url: https://huggingface.co/datasets/MMInstruction/M3IT Project: https://m3-it.github.io/