MINT-CoT:在数学链推理中启用交错视觉标记
计算机视觉与模式识别
2025-06-06 v1
摘要
链式思维(Chain-of-Thought,CoT)已在大型语言模型(LLM)中广泛提升了数学推理能力,但将其扩展到多模态领域仍具有挑战性。现有方法要么采用类似文本化推理处理图像输入,要么试图将视觉信号嵌入数学CoT中。然而,这些方法在数学问题求解方面存在三个关键局限:依赖粗糙的矩形图像区域、视觉编码器对数学内容的感知能力有限,以及依赖外部工具实现视觉修改。本文提出了MINT-CoT,引入数学链推理中的交错视觉标记(Mathematical INterleaved Tokens for Chain-of-Thought)。MINT-CoT通过一种称为Interleave Token的机制,动态选择数学图形中任意形状的视觉区域,将相关视觉标记交错嵌入文本推理步骤中。为实现此功能,我们构建了MINT-CoT数据集,包含54K个数学问题,每个推理步骤均与视觉区域在标记级别对齐,并配有严格的数据生成流程。我们进一步提出了三阶段的MINT-CoT训练策略,依次组合文本-only CoT监督学习、交错CoT监督学习和交错CoT强化学习,得到我们的MINT-CoT-7B模型。大量实验表明,我们的方法在数学领域实现了有效的视觉交错推理,MINT-CoT-7B模型在MathVista上以+34.08%的提升、在GeoQA上以+28.78%的提升、在MMStar上以+23.2%的提升显著优于基线模型。我们的代码和数据已公开于https://github.com/xinyan-cxy/MINT-CoT。
引用
@article{arxiv.2506.05331,
title = {MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning},
author = {Xinyan Chen and Renrui Zhang and Dongzhi Jiang and Aojun Zhou and Shilin Yan and Weifeng Lin and Hongsheng Li},
journal= {arXiv preprint arXiv:2506.05331},
year = {2025}
}
备注
Code is released at https://github.com/xinyan-cxy/MINT-CoT