中文

DSDR:用于LLM推理中探索的双尺度多样性正则化

机器学习 2026-02-24 v1 计算与语言

摘要

基于验证器的强化学习(RLVR)是改进大型语言模型(LLM)推理的核心范式,但现有方法常因探索不足而受限。策略倾向于坍缩至少数几种推理模式,过早终止深层探索;而常规熵正则化仅引入局部随机性,难以诱导有意义的路径级多样性,导致基于群组的策略优化中学习信号弱且不稳定。我们提出DSDR(Dual-Scale Diversity Regularization,双尺度多样性正则化)框架,通过分解LLM推理中的全局与耦合性成分来实现探索。全局层面,DSDR促进正确推理轨迹之间的多样性,以探索不同的解题模式。局部层面,DSDR对正确轨迹施加长度不变的、基于token的熵正则化,防止每个模式内部的熵坍缩,同时保持正确性。两种尺度通过全局到局部分配机制相互耦合,强调对更具辨识度的正确轨迹进行局部正则化。我们提供理论支持,表明DSDR在正则化受限的情况下保持最优正确性,能够在基于群组的优化中维持信息丰富的学习信号,并给出原则化的全局到局部分配规则。实验在多个推理基准上表现出在准确率和 pass@k 上的持续性提升,凸显双尺度多样性对RLVR中深层探索的重要性。代码已公开于 https://github.com/SUSTechBruce/DSDR。

关键词

引用

@article{arxiv.2602.19895,
  title  = {DSDR: Dual-Scale Diversity Regularization for Exploration in LLM Reasoning},
  author = {Zhongwei Wan and Yun Shen and Zhihao Dou and Donghao Zhou and Yu Zhang and Xin Wang and Hui Shen and Jing Xiong and Chaofan Tao and Zixuan Zhong and Peizhou Huang and Mi Zhang},
  journal= {arXiv preprint arXiv:2602.19895},
  year   = {2026}
}