中文

SERL:开放域上的自我审查强化学习

机器学习 2026-02-26 v3

摘要

强化学习 (RL) 已被证明能够提升大语言模型 (LLM) 的能力。然而,将 RL 应用于开放域任务面临两个关键挑战:(1) 这些任务固有的主观性阻碍了可验证奖励强化学习 (RLVR) 所需的可验证奖励;(2) 人类反馈强化学习 (RLHF) 依赖于外部奖励机制。为了克服这些局限性,我们提出了自我审查强化学习 (SERL),这是一种新颖的自我改进框架,其中 LLM 同时充当 Actor 和 Judge。SERL 引入了两种协同的奖励机制,且无需任何外部信号。一方面,为了提升 Actor 的能力,我们从一组生成响应的 Copeland 式成对比较判断中推导出奖励。另一方面,提出了一种鼓励一致判断的自一致性奖励,以提高 Judge 的可靠性。这一过程提升了 Judge 的能力,进而为 Actor 提供更稳健的奖励。实验表明,我们的方法优于现有的自我改进训练方法。SERL 将 Qwen3-8B 在 AlpacaEval 2 上的 LC 胜率从 52.37% 提升至 59.90%。据我们所知,我们的方法在自我改进方法中达到了 SOTA 性能。此外,它取得了与 Qwen3-32B 等显著更大的模型相当的性能,证明了在开放域任务上卓越的有效性和稳健性。

关键词

引用

@article{arxiv.2511.07922,
  title  = {SERL: Self-Examining Reinforcement Learning on Open-Domain},
  author = {Weixuan Ou and Yanzhao Zheng and Shuoshuo Sun and Wei Zhang and Baohua Dong and Hangcheng Zhu and Ruohui Huang and Gang Yu and Pengwei Yan and Yifan Qiao},
  journal= {arXiv preprint arXiv:2511.07922},
  year   = {2026}
}

备注

Accepted by the 40th AAAI Conference on Artificial Intelligence (AAAI 2026)