中文

MMFineReason:通过开放数据导向方法弥合多模态推理鸿沟

计算机视觉与模式识别 2026-01-30 v1

摘要

近期视觉语言模型 (VLM) 的进展推动了视觉推理的显著进步。然而,开源 VLM 仍滞后于专有系统,主要由于缺乏高质量推理数据。现有数据集覆盖有限,尤其是 STEM 图表和视觉拼图等具挑战性领域,且缺乏一致且持续的链式思考 (Chain-of-Thought, CoT) 注释,这些注释对于激发强大推理能力至关重要。为弥合这一鸿沟,我们引入 MMFineReason,一个大规模多模态推理数据集,包含 180 万个样本和 51 亿个解答 token,具有从 Qwen3-VL-235B-A22B-Thinking 提炼的高质量推理注释。该数据集通过系统性的三阶段管道建立:(1) 大规模数据收集与标准化、(2) CoT 推理过程生成、(3) 基于推理质量和难度感知的全面筛选。 resulting 数据集涵盖 STEM 问题、视觉拼图、游戏和复杂图表,每个样本均标注有视觉化推理�迹。我们在 MMFineReason 上微调 Qwen3-VL-Instruct 以开发 MMFineReason-2B/4B/8B 版本。我们的模型在各自规模类别中建立了新的最佳结果。值得注意的是,MMFineReason-4B 成功超越了 Qwen3-VL-8B-Thinking,MMFineReason-8B 甚至超过 Qwen3-VL-30B-A3B-Thinking,同时接近 Qwen3-VL-32B-Thinking,显示出显著的参数效率。至关重要的是,我们通过难度感知筛选策略发现“少即是多”现象:仅 7% (12.3 万个样本) 的子集即可实现与完整数据集相当的性能。我们进一步发现,推理导向的数据组合展现出协同效应,能够同时提升通用能力。

关键词

引用

@article{arxiv.2601.21821,
  title  = {MMFineReason: Closing the Multimodal Reasoning Gap via Open Data-Centric Methods},
  author = {Honglin Lin and Zheng Liu and Yun Zhu and Chonghan Qin and Juekai Lin and Xiaoran Shang and Conghui He and Wentao Zhang and Lijun Wu},
  journal= {arXiv preprint arXiv:2601.21821},
  year   = {2026}
}