中文

双难度感知自演化用于数据高效强化学习

机器学习 2026-05-19 v1 人工智能 计算与语言

摘要

强化学习(RL)已显示出增强大型语言模型(LLM)推理能力的潜力。然而,有效的 RL 训练——需要中等难度训练样本——面临两个根本性挑战:有效数据稀缺和难度动态变化,其中中等难度样本稀缺且随模型改进变得平凡。现有方法通过生成训练样本来一定程度缓解这种稀缺性,但这些方法 suffer from 锚驱动的生成,忽略了共演化问题,以及难度不匹配。为解决这些问题,我们提出了 D2^2Evo,即双难度感知自演化(Dual Difficulty-aware self-Evolution)RL 框架。在每个迭代中,我们的方法基于当前 Solver 的能力挖掘中等难度锚点,训练 Questioner 在合适的难度水平上生成多样化问题,并联合优化两个组件,以实现逐步推理收益。大量实验表明,D2^2Evo 在数学推理基准测试中以不到 2K 条真实数学样本的情况下超越现有方法,并在通用推理基准测试中表现出强大的泛化能力。

关键词

引用

@article{arxiv.2605.17037,
  title  = {D$^2$Evo: Dual Difficulty-Aware Self-Evolution for Data-Efficient Reinforcement Learning},
  author = {Ru Zhang and Renda Li and Ziyu Ma and Weijie Qiu and Chongyang Tao and Yong Wang and Xiangxiang Chu},
  journal= {arXiv preprint arXiv:2605.17037},
  year   = {2026}
}

备注

Accepted by ICML 2026. First two authors contributed equally