中文

MAVIS:基于数学视觉指令微调的自动数据引擎

计算机视觉与模式识别 2024-11-05 v2

摘要

多模态大语言模型(MLLMs)的数学能力仍未得到充分探索,主要集中在三个方面:数学图表的视觉编码、图表-语言对齐,以及链式思维(CoT)推理。这引发了对有效训练范式和大规模、全面且包含详细CoT论证的数据集的迫切需求,而这在收集和手动标注方面具有挑战。为此,我们提出MAVIS(MAthematical VISual instruction tuning pipeline),一种用于MLLMs的数学视觉指令微调流程,特别是配备自动数据引擎以高效创建数学视觉数据集。我们设计的数据生成过程完全独立于人工干预或GPT API的使用,同时确保图表-描述对应、问答正确性以及CoT推理质量。通过此方法,我们构建了两个数据集:MAVIS-Caption(55.8万图表-描述对)和MAVIS-Instruct(83.4万带CoT论证的视觉数学问题),并提出了四个渐进的训练阶段,用于从零开始训练MLLMs。首先,我们利用MAVIS-Caption通过对比学习微调一个数学专用视觉编码器(CLIP-Math),以适应更好的图表视觉编码。其次,我们同样利用MAVIS-Caption,通过投影层将CLIP-Math与大语言模型(LLM)对齐,提升数学领域的视觉-语言对齐。第三,我们采用MAVIS-Instruct进行指令微调,以获得鲁棒的问题解决能力,得到的模型称为MAVIS-7B。第四,我们应用直接偏好优化(DPO)来增强模型的CoT能力,进一步细化其逐步推理性能。代码和数据将在https://github.com/ZrrSkywalker/MAVIS发布。

关键词

引用

@article{arxiv.2407.08739,
  title  = {MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data Engine},
  author = {Renrui Zhang and Xinyu Wei and Dongzhi Jiang and Ziyu Guo and Shicheng Li and Yichi Zhang and Chengzhuo Tong and Jiaming Liu and Aojun Zhou and Bin Wei and Shanghang Zhang and Peng Gao and Chunyuan Li and Hongsheng Li},
  journal= {arXiv preprint arXiv:2407.08739},
  year   = {2024}
}

备注

WData and Models will be released at https://github.com/ZrrSkywalker/MAVIS