中文

PopuLoRA:基于 LLM 种群的推理自我对弈

人工智能 2026-05-19 v1

摘要

我们提出 PopuLoRA,一个面向 LLM 验证奖励强化学习(RLVR)后训练的种群基异构自我对弈框架。教师与学生是共享冻结底座上的特殊 LoRA 适配器:教师提出问题,匹配的学生在程序化验证器下解答,子种群之间的交叉评估取代单智能体自我校准的限制。我们设计了一系列 LoRA 权重空间演化算子(产生相同秩种群成员的变异与交叉,可在秒级完成),作为种群训练循环的替换步骤,在 7B 规模下实现。我们在 Absolute Zero Reasoner 之上实例化 PopuLoRA,并将其与按计算匹配的单模态基线进行比较。在单模态自我校准中,智能体会生成它可可靠解决的简单问题;而种群则进入共演化的武装竞赛:教师产生越来越复杂的问题,学生解题率呈振荡,问题空间覆盖范围不断扩大。尽管训练时的奖励较低,种群均值在三个代码基准(HumanEval+、MBPP+、LiveCodeBench)和七个数学基准(AIME 24/25、AMC 23、MATH-500、Minerva、GSM8K、OlympiadBench)中超越基线,即使是种群中最弱的成员在综合指标上也战胜了基线。

关键词

引用

@article{arxiv.2605.16727,
  title  = {PopuLoRA: Co-Evolving LLM Populations for Reasoning Self-Play},
  author = {Roger Creus Castanyer and Geoffrey Bradway and Lorenz Wolf and Maxwill Lin and Augustine N. Mavor-Parker and Matthew James Sargent},
  journal= {arXiv preprint arXiv:2605.16727},
  year   = {2026}
}