中文

强化学习驱动的多模态大语言模型推理综述

人工智能 2025-05-22 v2

摘要

将强化学习应用于提高多模态大语言模型推理能力的研究正处于快速发展阶段。虽然多模态大语言模型扩展了大语言模型,使其能够处理视觉、音频和视频等多种模态,实现跨模态输入的鲁棒推理仍面临挑战。本文系统回顾了近期在多模态大语言模型中基于强化学习的推理进展,涵盖关键算法设计、奖励机制创新及实际应用。我们概述了两种主要的强化学习范式,即基于价值模型无关和基于价值模型的方法,并分析了强化学习如何通过优化推理轨迹和对齐多模态信息来提升推理能力。此外,我们提供了关于基准数据集、评估协议及当前局限性的广泛概述,并提出了针对稀疏奖励、跨模态推理效率低下及实际部署约束等挑战的未来研究方向。我们的目标是为强化学习驱动的多模态推理提供全面且结构化的指南。

关键词

引用

@article{arxiv.2504.21277,
  title  = {Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models},
  author = {Guanghao Zhou and Panjia Qiu and Cen Chen and Jie Wang and Zheming Yang and Jian Xu and Minghui Qiu},
  journal= {arXiv preprint arXiv:2504.21277},
  year   = {2025}
}