ViRC:通过理由分块增强视觉交错数学思维链
计算机视觉与模式识别
2026-03-06 v3
摘要
思维链(CoT)显著提升了大语言模型的推理能力,但在扩展到多模态领域时面临挑战,尤其是在数学任务中。现有的多模态大语言模型(MLLMs)仅从单个静态数学图像进行文本推理,忽略了推理过程中动态的视觉获取。在 contrastively,人类会反复查看视觉图像并采用分步骤的推理方法来证明中间命题。这种将问题解决过程分解为关键逻辑节点的方法遵循认知科学中的米勒定律。灵感来自这一洞见,我们提出了用于多模态数学任务的 ViRC 框架,引入理由分块(Reason Chunking)机制,将多模态数学思维链结构化为连续的关键推理单元(CRUs),以模拟人类专家的问题解决模式。CRUs 确保单元内的文本连贯性,以验证中间命题,同时整合跨单元的视觉信息以生成后续命题并支持结构化推理。为此,我们使用三种视觉工具和四种推理模式构建了 CRUX 数据集,为每个数学问题提供多个推理路径上的显式标注 CRUs。在 CRUX 数据集上,我们提出了受人类认知学习启发的渐进式训练策略,包括指令微调(Instructional SFT)、练习微调(Practice SFT)和战略强化学习(Strategic RL),旨在进一步强化模型的理由分块能力。最终得到的 ViRC-7B 模型在多个数学基准测试中相较于基线模型实现了 18.8% 的平均提升。代码已公开 https://github.com/Leon-LihongWang/ViRC。
引用
@article{arxiv.2512.14654,
title = {ViRC: Enhancing Visual Interleaved Mathematical CoT with Reason Chunking},
author = {Lihong Wang and Liangqi Li and Weiwei Feng and Jiamin Wu and Changtao Miao and Tieru Wu and Rui Ma and Bo Zhang and Zhe Li},
journal= {arXiv preprint arXiv:2512.14654},
year = {2026}
}
备注
Accepted to CVPR 2026 (Main Track)