中文

生成对抗推理器:通过对抗强化学习提升 LLM 推理能力

人工智能 2026-03-26 v3 计算与语言 机器学习

摘要

具备显式推理能力的大语言模型(LLM)在数学推理方面表现突出,但仍会出现过程错误,如错误计算、脆弱逻辑和表面合理但无效的步骤。本文引入 Generative Adversarial Reasoner,一个旨在通过对抗强化学习提升推理能力的 on-policy 联合训练框架,通过 co-evolution 训练 LLM 推理器和 LLM 基 discriminators。一种计算高效的评审计划将每个推理链划分为逻辑完整且长度相当的片段,判 discriminators 对每个片段的正确性给出简洁、结构化的依据。学习将互补信号耦合在一起:LLM 推理器因逻辑一致且得出正确答案的步骤获得奖励,而判 discriminators 则因正确检测错误或区分推理过程中痕迹而获得奖励。这产生稠密、良好校准的、基于 on-policy 的步骤级奖励,补充稀疏的 exact-match 信号,改进信用分配、提高样本效率并提升 LLM 的整体推理质量。在各种数学基准测试中,该方法在保持标准 RL post-training 的强基准上 consistently 提供显著提升。具体而言,在 AIME24 上,我们将 DeepSeek-R1-Distill-Qwen-7B 从 54.0 提升至 61.3(+7.3),DeepSeek-R1-Distill-Llama-8B 从 43.7 提升至 53.7(+10.0)。这种模块化判 discriminators 也支持教师蒸馏、偏好对齐和基于数学证明的推理等目标的灵活奖励塑造。

关键词

引用

@article{arxiv.2512.16917,
  title  = {Generative Adversarial Reasoner: Enhancing LLM Reasoning with Adversarial Reinforcement Learning},
  author = {Qihao Liu and Luoxin Ye and Wufei Ma and Yu-Cheng Chou and Alan Yuille},
  journal= {arXiv preprint arXiv:2512.16917},
  year   = {2026}
}

备注

Camera-ready version