中文

MM-HELIX:通过整体平台与自适应混合策略优化提升多模态长链反思推理

计算机视觉与模式识别 2025-10-14 v2

摘要

虽然当前的多模态大语言模型(MLLM)在数学和逻辑等推理任务上已展现出能力,但它们在长链反思推理方面的能力——解决复杂现实问题的先决条件——仍 largely 未被探索。在本工作中,我们首先进行了广泛的实证研究来评估这一能力。利用精心设计的数据合成引擎,我们构建了MM-HELIX,一个包含1260个样本的多模态基准,涵盖42个需要迭代思考和回溯的具有挑战性的合成任务。在该基准上的实证结果表明,现有MLLM在长链反思推理方面存在显著性能缺陷。为解决这一限制,我们生成了后训练数据,并进一步探索了利用此类数据的学习范式。我们首先开发了步骤触发响应生成流水线,以创建MM-HELIX-100K,一个包含100k高质量反思推理轨迹的大规模数据集。鉴于标准强化学习在复杂任务上因稀疏奖励信号和监督微调后的灾难性遗忘而失败,我们提出了自适应混合策略优化(AHPO),一种将离线监督与在线优化动态统一为单一阶段的新训练策略。当奖励稀疏时,该策略使模型能够从专家数据中学习,一旦熟练后则进行独立探索。应用于Qwen2.5-VL-7B基线时,我们的方法在MM-HELIX基准上实现了+18.6%的准确率提升,并在一般数学和逻辑任务上展示了+5.7%的平均性能增益。我们的工作证明MLLM中的反思推理可以被有效学习和泛化,为开发更强大的MLLM铺平了道路。

关键词

引用

@article{arxiv.2510.08540,
  title  = {MM-HELIX: Boosting Multimodal Long-Chain Reflective Reasoning with Holistic Platform and Adaptive Hybrid Policy Optimization},
  author = {Xiangyu Zhao and Junming Lin and Tianhao Liang and Yifan Zhou and Wenhao Chai and Yuzhe Gu and Weiyun Wang and Kai Chen and Gen Luo and Wenwei Zhang and Junchi Yan and Hua Yang and Haodong Duan and Xue Yang},
  journal= {arXiv preprint arXiv:2510.08540},
  year   = {2025}
}