CURE:基于关键记token引导的重新拼接,用于熵崩溃预防
机器学习
2025-08-26 v2 人工智能
摘要
近期在验证奖励(RLVR)中的强化学习进展推动了更复杂认知行为在大型语言模型(LLM)中出现,增强了其推理能力。然而,在先前的RLVR管道中,静态初始状态抽样在每次抽样阶段严格来自数据分布,导致模型行为过于确定性、样本性差,表现为快速熵崩溃,阻碍了持续训练中的性能提升。为此,我们引入CURE(Critical-token-gUided Re concatenation for Entropy-collapse prevention),一个两阶段框架,在探索与开发之间取得平衡。具体而言,在第一个阶段,为引导模型向新颖且连贯的上下文靠拢,我们对关键记忆token进行高熵重生成,并联合优化原始轨迹与分支轨迹。与vanilla DAPO的进一步比较表明,重生成过程在数学推理任务中实现更好性能,同时保持较高的熵水平以进行探索。在第二个阶段,我们采用DAPO的静态初始状态抽样继续训练,故意将模型置于熟悉状态,以逐步加强开发。针对Qwen-2.5-Math-7B进行大量实验表明,与其他RLVR方法相比,CURE在六个数学基准测试中实现5%的性能提升,在熵和准确率方面均达到最先进水平。一系列实验进一步验证了我们方法的有效性。代码已公开于 https://github.com/bytedance/CURE。
引用
@article{arxiv.2508.11016,
title = {CURE: Critical-Token-Guided Re-Concatenation for Entropy-Collapse Prevention},
author = {Qingbin Li and Rongkun Xue and Jie Wang and Ming Zhou and Zhi Li and Xiaofeng Ji and Yongqi Wang and Miao Liu and Zheming Yang and Minghui Qiu and Jing Yang},
journal= {arXiv preprint arXiv:2508.11016},
year = {2025}
}