中文

RL-STaR:自学习推理器强化学习框架的理论分析

人工智能 2025-04-11 v2 机器学习

摘要

大型语言模型(LLMs)的推理能力已通过思维链(CoT)提示得到提升,使模型能够逐步解决复杂任务。然而,训练CoT能力需要详细的推理数据,而这些数据通常很稀缺。自学习推理器(STaR)框架通过使用强化学习自动生成推理步骤来解决此问题,从而减少了对人工标注数据的依赖。尽管STaR及其变体在经验上取得了成功,但缺乏解释这些改进的理论基础。本工作为理解强化学习在CoT推理和STaR上的有效性提供了一个理论框架。我们的贡献包括:(1)启动有效推理改进所需的预训练模型质量标准;(2)策略改进分析,展示了LLM推理为何能通过STaR迭代提升;(3)收敛到最优推理策略的条件;以及(4)对STaR鲁棒性的检验,解释了它即使在包含偶尔的错误步骤时也能改进推理的原因。该框架旨在弥合经验发现与理论洞见之间的差距,推动LLM中推理的强化学习方法发展。

关键词

引用

@article{arxiv.2410.23912,
  title  = {RL-STaR: Theoretical Analysis of Reinforcement Learning Frameworks for Self-Taught Reasoner},
  author = {Fu-Chieh Chang and Yu-Ting Lee and Hui-Ying Shih and Yi Hsuan Tseng and Pei-Yuan Wu},
  journal= {arXiv preprint arXiv:2410.23912},
  year   = {2025}
}