中文

无后悔推理

机器学习 2025-04-15 v1 人工智能

摘要

链式思维推理使大语言模型能够通过将问题解决框架定为顺序决策问题来解决多步骤任务。基于结果的奖励仅对最终答案提供反馈,展现出惊人的成功,但在信用分配和收敛速度方面面临挑战。相比之下,基于程序的奖励提供了高效的步骤级反馈,但通常需要高昂的人工监督。我们提出一种无后悔框架 Backwards Adaptive Reward Shaping(BARS),将稀疏结果导向奖励转换为有效的程序信号。BARS 使用来自终端状态的先验和覆盖树生成稀疏奖励,以实现奖励规模化并防止被利用。结合 Bellman 收缩和 (Δ,ϵ)(\Delta, \epsilon)-间隙奖励,我们的逆向 Euler 求解器在 O((Rmax/Δ)log(1/ϵ))O\left((R_{\max}/\Delta)\log(1/\epsilon)\right) 次迭代中实现 ϵ\epsilon 精度,动态 regret 为 O(logT)O(\log T)。我们的分析基于通用链、连续扩展极限和非线性 Feynman-Kac 边界,将近期结果导向方法的实证成功与中间监督的优势联系起来。综合后者,首次为结果奖励塑形提供严格的无后悔算法,为 DeepSeek R1 实证成功提供了理论基础。

关键词

引用

@article{arxiv.2504.09777,
  title  = {Reasoning without Regret},
  author = {Tarun Chitra},
  journal= {arXiv preprint arXiv:2504.09777},
  year   = {2025}
}