RL-STaR:自学习推理器强化学习框架的理论分析
人工智能
2025-04-11 v2 机器学习
摘要
大型语言模型(LLMs)的推理能力已通过思维链(CoT)提示得到提升,使模型能够逐步解决复杂任务。然而,训练CoT能力需要详细的推理数据,而这些数据通常很稀缺。自学习推理器(STaR)框架通过使用强化学习自动生成推理步骤来解决此问题,从而减少了对人工标注数据的依赖。尽管STaR及其变体在经验上取得了成功,但缺乏解释这些改进的理论基础。本工作为理解强化学习在CoT推理和STaR上的有效性提供了一个理论框架。我们的贡献包括:(1)启动有效推理改进所需的预训练模型质量标准;(2)策略改进分析,展示了LLM推理为何能通过STaR迭代提升;(3)收敛到最优推理策略的条件;以及(4)对STaR鲁棒性的检验,解释了它即使在包含偶尔的错误步骤时也能改进推理的原因。该框架旨在弥合经验发现与理论洞见之间的差距,推动LLM中推理的强化学习方法发展。
引用
@article{arxiv.2410.23912,
title = {RL-STaR: Theoretical Analysis of Reinforcement Learning Frameworks for Self-Taught Reasoner},
author = {Fu-Chieh Chang and Yu-Ting Lee and Hui-Ying Shih and Yi Hsuan Tseng and Pei-Yuan Wu},
journal= {arXiv preprint arXiv:2410.23912},
year = {2025}
}