中文

MMDU:面向LVLMs的多回合多图像对话理解基准与指令微调数据集

计算机视觉与模式识别 2024-10-30 v2 人工智能 机器学习

摘要

生成自然且有意义的响应以与多模态人类输入进行交流,是大型视觉语言模型(LVLMs)的基本能力。虽然当前开源LVLMs在简化场景(如单轮单图输入)中表现前景,但在现实世界的对话场景(如在长上下文历史中跟随多轮指令)方面仍显不足。现有LVLMs基准主要聚焦于单选题或短形式响应,无法充分评估LVLMs在现实人机交互应用中的能力。因此,我们引入MMDU,这是一个全面的基准,以及MMDU-45k,这是一个大规模指令微调数据集,旨在评估和改进LVLMs在多轮多图像对话中的能力。我们采用聚类算法从开源Wikipedia中找到相关图像和文本描述,并通过辅助GPT-4o模型的人类标注员构建问答对。MMDU的最大图像+文本token数为18万,最多包含20张图像和27轮对话,至少是之前基准的5倍,对当前LVLMs构成挑战。我们对15个代表性LVLMs进行深入分析,发现开源LVLMs因受限的对话指令微调数据而落后于闭源模型。我们演示了在MMDU-45k上微调开源LVLMs可显著缩小这一差距,生成更长更准确的对话,提高了MMDU和现有基准(MMStar:+1.1%,MathVista:+1.5%,ChartQA:+1.2%)的得分。我们的贡献为弥合当前LVLM模型与实际应用需求之间的差距奠定了道路。该项目可在 https://github.com/Liuziyu77/MMDU 获取。

关键词

引用

@article{arxiv.2406.11833,
  title  = {MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs},
  author = {Ziyu Liu and Tao Chu and Yuhang Zang and Xilin Wei and Xiaoyi Dong and Pan Zhang and Zijian Liang and Yuanjun Xiong and Yu Qiao and Dahua Lin and Jiaqi Wang},
  journal= {arXiv preprint arXiv:2406.11833},
  year   = {2024}
}

备注

This project is available at https://github.com/Liuziyu77/MMDU