中文

通过逆强化学习从专家演示中学习推理奖励

人工智能 2026-05-19 v5

摘要

教育大型语言模型 (LLM) 在后训练期间推理,通常依赖于基于明确结果或过程的奖励函数。然而,在许多实际场景中,获取或定义此类奖励函数困难,尤其是针对复杂任务,使从专家演示中学习成为引人注目的替代方案。占主导地位的方法是监督微调 (SFT),它训练模型直接模仿专家推理痕迹,但受制于离策略学习的通用局限:性能对推理时间偏离 demonstrations 中明确覆盖的状态十分敏感。为此,我们提出推理对抗逆强化学习 (Reasoning Adversarial Inverse Reinforcement Learning, R-AIRL)。R-AIRL 不通过模仿专家的推理,而是从专家链式思维中推断 underlying 过程级奖励。通过在 GSM8K、MMLU-Pro 和 MedReason 上进行实验,我们表明使用 R-AIRL 学习的推理奖励函数可有效用于训练和推理管道:(1) 为后训练提供训练信号,在大多数考虑的设置下优于 SFT;(2) 用于推理时间重排序,使 pass@1 提升最高可达 17.4 分;(3) 用于过程级评估,以最高可达 86.1% 的准确率定位推理失败。总体而言,R-AIRL 桥接了模仿学习和基于奖励的优化,使能够从专家思维痕迹中提取有意义的推理信号。

关键词

引用

@article{arxiv.2510.01857,
  title  = {Learning Reasoning Rewards from Expert Demonstrations with Inverse Reinforcement Learning},
  author = {Claudio Fanconi and Nicolás Astorga and Mihaela van der Schaar},
  journal= {arXiv preprint arXiv:2510.01857},
  year   = {2026}
}