中文

强化微调提升多模态大语言模型推理能力

计算与语言 2025-05-27 v1 人工智能 计算机视觉与模式识别

摘要

在2025年,这是一个向人工通用智能(AGI)迈进的关键节点,强化微调(Reinforcement Fine-Tuning, RFT)已在提升大语言模型(LLM)推理能力方面展现出巨大潜力,并催生了OpenAI-o1和DeepSeek-R1等前沿AI模型。此外,将RFT高效应用于提升多模态大语言模型(MLLM)推理能力也引发了社区广泛关注。本位论文我们认为,强化微调是多模态大语言模型推理能力的核心驱动力。首先,我们提供了该领域研究者应熟悉的详细背景知识。进而,我们细致地将RFT在提升MLLM推理能力方面的改进总结为五个关键点:多样化的模态、多样化的任务与领域、更优的训练算法、丰富的基准测试以及蓬勃发展的工程框架。最后,我们提出了五个可能为社区考虑的未来研究方向。我们希望本位论文能为AGI这一关键发展阶段的社区提供宝贵洞见。关于RFT用于MLLM的工作总结,链接为https://github.com/Sun-Haoyuan23/Awesome-RL-based-Reasoning-MLLMs。

关键词

引用

@article{arxiv.2505.18536,
  title  = {Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models},
  author = {Haoyuan Sun and Jiaqi Wu and Bo Xia and Yifu Luo and Yifei Zhao and Kai Qin and Xufei Lv and Tiantian Zhang and Yongzhe Chang and Xueqian Wang},
  journal= {arXiv preprint arXiv:2505.18536},
  year   = {2025}
}