双难度感知自演化用于数据高效强化学习
机器学习
2026-05-19 v1 人工智能
计算与语言
摘要
强化学习(RL)已显示出增强大型语言模型(LLM)推理能力的潜力。然而,有效的 RL 训练——需要中等难度训练样本——面临两个根本性挑战:有效数据稀缺和难度动态变化,其中中等难度样本稀缺且随模型改进变得平凡。现有方法通过生成训练样本来一定程度缓解这种稀缺性,但这些方法 suffer from 锚驱动的生成,忽略了共演化问题,以及难度不匹配。为解决这些问题,我们提出了 DEvo,即双难度感知自演化(Dual Difficulty-aware self-Evolution)RL 框架。在每个迭代中,我们的方法基于当前 Solver 的能力挖掘中等难度锚点,训练 Questioner 在合适的难度水平上生成多样化问题,并联合优化两个组件,以实现逐步推理收益。大量实验表明,DEvo 在数学推理基准测试中以不到 2K 条真实数学样本的情况下超越现有方法,并在通用推理基准测试中表现出强大的泛化能力。
引用
@article{arxiv.2605.17037,
title = {D$^2$Evo: Dual Difficulty-Aware Self-Evolution for Data-Efficient Reinforcement Learning},
author = {Ru Zhang and Renda Li and Ziyu Ma and Weijie Qiu and Chongyang Tao and Yong Wang and Xiangxiang Chu},
journal= {arXiv preprint arXiv:2605.17037},
year = {2026}
}
备注
Accepted by ICML 2026. First two authors contributed equally