中文

MAmmoTH-VL:大规模指令调校激发多模态推理能力

广义相对论与量子宇宙学 2025-04-09 v2

摘要

开源多模态大语言模型(MLLM)在广泛的多模态任务中显示出显著潜力。然而,其推理能力受限于现有指令调校数据集,这些数据集主要来自 VQA、AI2D 和 ChartQA 等学术数据集。这些数据集针对简单任务,仅提供短语级答案,缺乏中间推理过程。为此,我们引入一种可扩展且高性价比的方法,用于构建大规模多模态指令调校数据集,包含丰富的中间推理步骤,以激发 CoT 推理。仅使用开源模型,我们创建了包含 1200 万条指令-响应对的数据集,涵盖多样化、推理密集型任务,提供详实且忠实的推理过程。实验表明,在该数据集上训练 MLLM 可显著提升推理能力,在 MathVerse(提升 8.1%)、MIMU-Pro(提升 7%)和 MuirBench(提升 13.3%)等基准测试中实现最先进性能。此外,该模型在非推理基准测试上也提升了最高 4%。消融研究进一步突显了如重写和自过滤等数据集构建关键组件的重要性。

关键词

引用

@article{arxiv.2412.05236,
  title  = {Field Sources for Wormholes With Multiple Throats/Anti-throats},
  author = {T. M. Crispim and Marcos V. de S. Silva and G. Alencar and Celio R. Muniz and Diego Sáez-Chillón Gómez},
  journal= {arXiv preprint arXiv:2412.05236},
  year   = {2025}
}

备注

23 pages, 10 figures. V2: 29 pages, 11 figures, references added, typo fixed. Final version. Published in CQG