高效推理下的动态解耦条件优势
计算与语言
2026-02-03 v1 机器学习
摘要
基于可验证奖励的强化学习(RLVR)可引发强大的多步骤推理,但常导致过于冗长的推理轨迹。此外,基于组相对优化的简单长度惩罚会严重损害准确性。我们将此失败归因于两个结构性问题:(i)长度基准稀释,即错误响应(长度为零奖励)压低组基准并过度惩罚正确解答;(ii)难度-惩罚不匹配,即静态惩罚无法适应问题难度,在困难实例中抑制必要推理,而在简单实例中留下冗余。我们提出动态解耦条件优势(DDCA),以消除基准稀释,实现效率优化与正确性解耦。DDCA 在正确响应簇内条件性计算长度优势,并使用组通过率作为难度代理动态调整惩罚强度。在GSM8K、MATH500、AMC23 和 AIME25 上的实验表明,DDCA 在相对于自适应基准的效率-准确性权衡上始终取得改进,相对于简单任务(如GSM8K)减少约60%生成标记,相对于更难基准(如AIME25)减少约20%,从而在保持或提高准确性方面取得良好效果。代码已公开于 https://github.com/alphadl/DDCA。
引用
@article{arxiv.2602.02099,
title = {Think Dense, Not Long: Dynamic Decoupled Conditional Advantage for Efficient Reasoning},
author = {Keqin Peng and Yuanxin Ouyang and Xuebo Liu and Zhiliang Tian and Ruijian Han and Yancheng Yuan and Liang Ding},
journal= {arXiv preprint arXiv:2602.02099},
year = {2026}
}