中文

超越马尔可夫性:基于贝叶斯自适应强化学习的反思性探索用于大语言模型推理

机器学习 2025-12-09 v2 人工智能 计算与语言 机器学习

摘要

通过强化学习(RL)训练的大语言模型(LLMs)展现出强大的推理能力和涌现的反思行为,例如重新思考和纠错,作为一种上下文探索的形式。然而,传统RL训练获得的马尔可夫策略不会产生反思性探索行为,因为该策略仅通过状态依赖于历史,因此没有动机用额外上下文丰富相同状态。相反,RL探索仅在训练期间以试错方式学习最优策略时有用。因此,反思性推理是否会在RL期间涌现,或为何它是有益的,仍不清楚。为解决此问题,我们在贝叶斯RL框架内重新构建了反思性探索,该框架优化了由训练数据诱导的马尔可夫决策过程后验分布下的期望回报。这种贝叶斯公式允许不确定性自适应策略,通过信念更新,自然地激励信息收集行动并诱导自我反思行为。我们由此产生的算法BARL,指导LLM根据观察到的结果拼接和切换策略,为模型何时以及如何进行反思性探索提供了原则性指导。在合成和数学推理任务上的实证结果表明,BARL优于传统RL方法,在测试时性能和令牌效率上均取得更优表现。我们的代码可在 https://github.com/shenao-zhang/BARL 获取。

关键词

引用

@article{arxiv.2505.20561,
  title  = {Beyond Markovian: Reflective Exploration via Bayes-Adaptive RL for LLM Reasoning},
  author = {Shenao Zhang and Yaqing Wang and Yinxiao Liu and Tianqi Liu and Peter Grabowski and Eugene Ie and Zhaoran Wang and Yunxuan Li},
  journal= {arXiv preprint arXiv:2505.20561},
  year   = {2025}
}