中文

深入探究多模态推理的自进化训练

计算与语言 2025-06-09 v3 人工智能 计算机视觉与模式识别 机器学习

摘要

自进化训练——模型迭代地从自身输出中学习——已成为复杂推理任务的关键方法,解决了高质量思维链数据稀缺的问题。然而,其在多模态推理(一个比纯文本推理更复杂的领域)中的有效性仍未得到充分探索,且对该训练范式中关键因素的理解仍然有限。此外,该训练方法的一个核心挑战是性能饱和,这阻碍了进一步的改进和可扩展性。受强化学习启发,本文从强化学习的角度重新审视了多模态推理的自进化训练,识别出三个关键因素:训练方法、奖励模型和提示变化。通过系统分析,我们建立了相对最优的设计原则,显著增强了多模态推理能力。此外,深入探讨训练动态后,我们揭示了饱和的根源,并提出了一种新的自动平衡机制来缓解这一限制。基于这些见解,我们提出了M-STAR(多模态自进化推理训练)框架,该框架在不同规模的模型和多样化基准上实现了一致的性能提升。所有资源已在https://mstar-lmm.github.io公开。

关键词

引用

@article{arxiv.2412.17451,
  title  = {Diving into Self-Evolving Training for Multimodal Reasoning},
  author = {Wei Liu and Junlong Li and Xiwen Zhang and Fan Zhou and Yu Cheng and Junxian He},
  journal= {arXiv preprint arXiv:2412.17451},
  year   = {2025}
}

备注

ICML 2025, Project Page: https://mstar-lmm.github.io