中文

MultiMath:连接大语言模型的数学推理与视觉推理

计算与语言 2024-09-04 v1 人工智能

摘要

大型语言模型(LLM)的快速发展推动了对其特定领域能力的广泛研究,尤其是数学推理能力。然而,大多数开源 LLM 仅关注数学推理,忽略了与视觉输入集成,尽管许多数学任务依赖于诸如几何图表、图表和函数曲线等视觉输入。为填补这一空白,我们提出了一种多模态大语言模型 **MultiMath-7B**,以桥接数学与视觉之间的差距。**MultiMath-7B** 通过四阶段训练过程实现,包括视觉-语言对齐、视觉与数学指令微调以及过程监督强化学习。我们还构建了一个新颖、多样且全面的多模态数学数据集 **MultiMath-300K**,涵盖 K-12 各个年级水平,包含图像描述和分步骤解答。MultiMath-7B 在现有多模态数学基准测试中实现了开源模型的最先进(SOTA)性能,并在文本-only 数学基准测试中也表现出色。我们的模型和数据集可在 {\textcolor{blue}{\url{https://github.com/pengshuai-rin/MultiMath}}} 获取。

关键词

引用

@article{arxiv.2409.00147,
  title  = {MultiMath: Bridging Visual and Mathematical Reasoning for Large Language Models},
  author = {Shuai Peng and Di Fu and Liangcai Gao and Xiuqin Zhong and Hongguang Fu and Zhi Tang},
  journal= {arXiv preprint arXiv:2409.00147},
  year   = {2024}
}