中文

R-Diverse:缓解自我对弈LLM训练中的多样性幻觉

机器学习 2026-02-17 v2

摘要

自我对弈通过迭代的挑战者-解答者循环来引导LLM推理:挑战者训练生成针对解答者能力的题目,解答者针对生成数据进行优化以扩展其推理技能。然而,诸如R-Zero等现有框架常表现出非持续性的改进,即随着自我对弈进行,早期的收益会逐渐退化。我们识别出一种关键失效模式,即多样性幻觉,使得解答者的训练信号看似多样化,却在深层模式上坍缩。其表现为(1)局部多样性幻觉,即多样性仅在小批次内被强制实现,导致跨迭代模式循环;以及(2)表面多样性幻觉,即题目在表面上变化但需要近乎相同的推理技能。为缓解这些问题,我们提出R-Diverse,包含两个相互一致的创新:记忆增强惩罚(MAP),使用持久记忆库来抑制跨迭代的重复;以及技能感知测量(SAM),通过评估所练习的推理技能来衡量多样性,而非题目的表面变化。我们在10个数学和常规推理基准测试中表现,R-Diverse在更多迭代上维持收益,并持续优于先前的自我对弈方法。代码可在https://github.com/Gengsheng-Li/R-Diverse获取。

关键词

引用

@article{arxiv.2602.13103,
  title  = {R-Diverse: Mitigating Diversity Illusion in Self-Play LLM Training},
  author = {Gengsheng Li and Jinghan He and Shijie Wang and Dan Zhang and Ruiqi Liu and Renrui Zhang and Zijun Yao and Junfeng Fang and Haiyun Guo and Jinqiao Wang},
  journal= {arXiv preprint arXiv:2602.13103},
  year   = {2026}
}