中文

数据稀缺下面向大语言模型的强化学习综述:挑战与解决方案

机器学习 2026-04-21 v1 人工智能

摘要

强化学习(RL)已成为增强大语言模型(LLM)推理能力的一种强大的后训练范式。然而,面向LLM的强化学习面临着严重的数据稀缺挑战,包括高质量外部监督的有限可用性和模型生成经验的受限数量。这些限制使得数据高效的强化学习成为一个关键的研究方向。在本综述中,我们首次系统性地回顾了数据稀缺下面向LLM的强化学习。我们提出了一个自下而上的分层框架,该框架围绕三个互补的视角构建:数据为中心视角、训练为中心视角和框架为中心视角。我们建立了现有方法的分类法,总结了每个类别中的代表性方法,并分析了它们的优势和局限性。我们的分类法旨在为理解数据高效RL for LLM的设计空间提供一个清晰的概念基础,并指导从事这一新兴领域的研究人员。我们希望本综述能为未来的研究提供全面的路线图,并激发面向更高效、更可扩展的LLM强化学习后训练的新方向。

关键词

引用

@article{arxiv.2604.17312,
  title  = {A Survey of Reinforcement Learning for Large Language Models under Data Scarcity: Challenges and Solutions},
  author = {Zhiyin Yu and Yuchen Mou and Juncheng Yan and Junyu Luo and Chunchun Chen and Xing Wei and Yunhui Liu and Hongru Sun and Yuxing Zhang and Jun Xu and Yatao Bian and Ming Zhang and Wei Ye and Tieke He and Jie Yang and Guanjie Zheng and Zhonghai Wu and Bo Zhang and Lei Bai and Xiao Luo},
  journal= {arXiv preprint arXiv:2604.17312},
  year   = {2026}
}

备注

Accepted to ACL 2026 (Main Conference)