中文

SPC:通过对抗游戏演化自我对弈评论家用于 LLM 推理

计算与语言 2025-05-20 v2 人工智能 机器学习

摘要

评估大型语言模型(LLM)推理中,如链式思维(Chain-of-Thought),的逐步可靠性 remains challenging due to the difficulty and cost of obtaining high-quality step-level supervision。本文引入了自我对弈评论家(Self-Play Critic, SPC),一种新方法,其中评论模型通过对抗自我对弈游戏演化其评估推理步骤能力的方法,无需手动的步骤级标注。SPC涉及对基础模型的两个副本进行微调以扮演两个角色,即“狡诈生成器”,其故意产生难以察觉的错误步骤,以及“评论家”,其分析推理步骤的正确性。这两个模型在对抗游戏中进行互动,其中生成器旨取悦评论家,而评论模型 seeks to identify the generator's errors。基于游戏结果进行强化学习,模型不断迭代改进;每次对决的获胜者获得正奖励,失败者获得负奖励,从而驱动持续的自我演化。在三个推理过程基准测试(ProcessBench、PRM800K、DeltaBench)上的实验表明,我们的 SPC 逐渐增强了其错误检测能力(例如,在 ProcessBench 上准确率从 70.8% 提升至 77.7%),并超越了包括蒸馏 R1 模型在内的强基线。此外,SPC 可指导多种 LLM 的测试时搜索,显著提升其在 MATH500 和 AIME2024 上的数学推理性能,超越基于最先进的过程奖励模型所指导的模型。

关键词

引用

@article{arxiv.2504.19162,
  title  = {SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning},
  author = {Jiaqi Chen and Bang Zhang and Ruotian Ma and Peisong Wang and Xiaodan Liang and Zhaopeng Tu and Xiaolong Li and Kwan-Yee K. Wong},
  journal= {arXiv preprint arXiv:2504.19162},
  year   = {2025}
}

备注

Project webpage: https://chen-judge.github.io/SPC/