中文

通过双人位改进大语言模型推理能力

机器学习 2026-01-19 v3 人工智能 计算与语言

摘要

大型语言模型(LLM)通过强化学习与可验证奖励(RLVR)取得了显著进展,但仍高度依赖外部监督(如精选标签)。对抗学习,特别是自我对弈,提供了有前景的替代方案,使模型能够从自身中不断学习,从而减少对外部监督的依赖。双人位扩展了对抗学习,通过为两个模型分配特定角色并彼此训练,促进持续的竞争和相互演化。尽管前景光明,但将双人位训练适用于LLM仍受限,主要源于其对奖励作弊和训练不稳定性的脆弱性。本文引入PasoDoble,一种新的LLM双人位框架。PasoDoble对两个初始化自相同基础模型的模型进行对抗训练:Proposer生成具有真实答案的具有挑战性的问题,而Solver尝试解答这些问题。我们将来自预训练数据集的知识丰富Proposer,以确保问题的质量和多样性。为避免奖励作弊,Proposer因仅生成推动Solver极限的有效问题而获得奖励,而Solver因正确解答问题而获得奖励,两者进行联合更新。为进一步增强训练稳定性,我们引入可选的离线范式,通过固定另一个模型数步来交替更新Proposer和Solver。值得注意的是,PasoDoble在训练期间无需监督。实验结果表明,PasoDoble能够提高LLM的推理性能。我们的项目页面位于https://hcy123902.github.io/PasoDoble。

关键词

引用

@article{arxiv.2511.11881,
  title  = {Better LLM Reasoning via Dual-Play},
  author = {Zhengxin Zhang and Chengyu Huang and Aochong Oliver Li and Claire Cardie},
  journal= {arXiv preprint arXiv:2511.11881},
  year   = {2026}
}

备注

33 pages, 17 figures, 17 tables