MMEvol: Empowering Multimodal Large Language Models with Evol-Instruct
计算与语言
2025-01-03 v5
摘要
多模态大语言模型(MLLMs)的发展取得了显著进步,在各个领域(例如多模态智能体、具身智能)的需求日益增长。虽然模型驱动的方法试图通过多样化的架构来增强MLLMs的能力,但其收益已变得越来越有限。相反,数据驱动的方法通过扩大图像-文本指令数据的规模更为有效,但面临着数据多样性和复杂性有限的挑战。高质量数据的缺乏构成了MLLMs发展的一个重大障碍。为了解决数据质量瓶颈,我们提出了MMEvol,一种新颖的多模态指令数据进化框架。该框架通过精细感知、认知推理和交互进化的精炼组合,迭代地提高数据质量,生成一个更复杂、更多样的图像-文本指令数据集,从而赋予MLLMs增强的能力。从一组初始指令集SEED-163K开始,我们利用MMEvol系统地拓宽指令类型的多样性,扩展视觉推理步骤以提高视觉推理能力,并深入探索图像中的细粒度信息以增强视觉理解和鲁棒性。为了全面评估我们方法的有效性,我们在13个视觉-语言任务上进行了广泛的定性分析和定量实验。与使用初始种子数据训练的基线模型相比,结果表明我们的方法平均准确率提高了3.1个百分点。此外,与最先进的模型相比,我们的方法在使用显著更少数据的情况下,在九个任务中达到了最先进(SOTA)的性能。
引用
@article{arxiv.2409.05840,
title = {MMEvol: Empowering Multimodal Large Language Models with Evol-Instruct},
author = {Run Luo and Haonan Zhang and Longze Chen and Ting-En Lin and Xiong Liu and Yuchuan Wu and Min Yang and Minzheng Wang and Pengpeng Zeng and Lianli Gao and Heng Tao Shen and Yunshui Li and Xiaobo Xia and Fei Huang and Jingkuan Song and Yongbin Li},
journal= {arXiv preprint arXiv:2409.05840},
year = {2025}
}