中文

MathCoder-VL:跨模态数学推理中的视觉与代码桥接

计算机视觉与模式识别 2025-05-16 v1 人工智能 计算与语言

摘要

自然语言图像字caption数据集广泛用于训练大型多模态模型(LMM),但主要聚焦于自然场景,忽略了数学图形中关键细节,这些细节对于问题解决至关重要,限制了当前LMM在多模态数学推理方面的发展。为此,我们提出将代码作为跨模态对齐的监督信号,由于代码本质上编码了生成相应图形所需的全部信息,建立了两种模态之间的精确联系。具体而言,我们采用模型在环(model-in-the-loop)方法协同开发图像到代码模型(FigCodifier)和数据集,构建了目前为止最大的图像-代码数据集ImgCode-8.6M。进一步利用FigCodifier合成新型数学图形,然后构建MM-MathInstruct-3M——高质量多模态数学指令微调数据集。最后,我们提出MathCoder-VL,该模型首先在ImgCode-8.6M上进行跨模态对齐,再在MM-MathInstruct-3M上进行多模态数学问题求解微调。我们的模型在所有六项指标上实现了开源SOTA。值得注意的是,在MathVista几何问题求解子集中,MathCoder-VL相较于GPT-4o和Claude 3.5 Sonnet提升了8.9%和9.2%。该数据集和模型将在https://github.com/mathllm/MathCoder发布。

关键词

引用

@article{arxiv.2505.10557,
  title  = {MathCoder-VL: Bridging Vision and Code for Enhanced Multimodal Mathematical Reasoning},
  author = {Ke Wang and Junting Pan and Linda Wei and Aojun Zhou and Weikang Shi and Zimu Lu and Han Xiao and Yunqiao Yang and Houxing Ren and Mingjie Zhan and Hongsheng Li},
  journal= {arXiv preprint arXiv:2505.10557},
  year   = {2025}
}

备注

Accepted to ACL 2025 Findings