Training Multimodal Large Reasoning Models Needs Better Thoughts: A Three-Stage Framework for Long Chain-of-Thought Synthesis and Selection
人工智能
2026-02-17 v2 机器学习
摘要
大型推理模型 (LRM) 已通过长链式思维 (CoT) 推理在复杂推理任务上展现出惊人的性能。将这些成功扩展到多模态推理仍面临挑战,主要是由于整合多样输入模态的复杂性以及高质量长 CoT 训练数据稀缺的限制。现有多模态数据集和 CoT 合成方法仍受限于推理深度不足、模态转换错误以及僵化的生成管道,阻碍了模型性能和稳定性。为此,本文提出 SynSelect,一种针对多模态推理任务的三阶段合成-选择框架,用于生成高质量的长 CoT 数据。具体而言,SynSelect 首先利用多个异构多模态 LRM 生成多样化的候选 CoT,然后应用实例级和批级选择筛选能够有效提升模型推理能力的高质量 CoT。在多个多模态基准上的大量实验表明,在 SynSelect 生成的数据上监督微调的模型显著优于基线方法,并在强化学习后训练中实现进一步改进。我们的结果验证了 SynSelect 作为推进多模态 LRM 推理能力的有效方法。
引用
@article{arxiv.2512.18956,
title = {Training Multimodal Large Reasoning Models Needs Better Thoughts: A Three-Stage Framework for Long Chain-of-Thought Synthesis and Selection},
author = {Yizhi Wang and Linan Yue and Min-Ling Zhang},
journal= {arXiv preprint arXiv:2512.18956},
year = {2026}
}