Cog-DRIFT:通过适应性重构实例探索,实现从困难推理问题中学习
机器学习
2026-04-07 v1 人工智能
计算与语言
摘要
从可验证奖励的强化学习(RLVR)提高了LLM的推理能力,但仍存在根本性局限:当模型当前策略下难以解决的问题会产生无意义的奖励信号,导致模型无法从中学习。我们提出一种简单而有效的解决方案,基于任务重构。将具有挑战性的开放性问题转化为认知更简单的变体——如多选题和填空题格式——既保留原始答案,又减少有效搜索空间,提供更稠密的学习信号。这些重构span从判别性到生成性任务,我们利用其自适应课程:模型首先从结构化、更易的格式中学习,该知识随后传递回改善对原始开放性问题的表现。基于这一洞见,我们引入Cog-DRIFT,一个构建重构变体并根据难度组织自适应课程的框架。训练从更易到更难的格式进行,使模型能够从以往在标准RL后训练下产生零信号的问题中学习。Cog-DRIFT不仅在原本不可解决的难题上取得显著改进(Qwen提升+10.11%,Llama提升+8.64%),还能在其他保留下的数据集上良好泛化。在6个推理基准测试中,本方法持续优于标准GRPO和强导向探索基线。在平均情况下,Cog-DRIFT相对于第二名基线提升+4.72%(Qwen)和+3.23%(Llama)。我们进一步表明Cog-DRIFT提高了测试时pass@k指标,课程设计提升了样本效率。总体而言,本研究突显任务重构和课程学习作为克服LLM后训练中探索障碍的有效范式。
引用
@article{arxiv.2604.04767,
title = {Cog-DRIFT: Exploration on Adaptively Reformulated Instances Enables Learning from Hard Reasoning Problems},
author = {Justin Chih-Yao Chen and Archiki Prasad and Zaid Khan and Joykirat Singh and Runchu Tian and Elias Stengel-Eskin and Mohit Bansal},
journal= {arXiv preprint arXiv:2604.04767},
year = {2026}
}
备注
22 pages, 4 figures. Code: https://github.com/dinobby/Cog-DRIFT