中文

DiPO:解缚 Perplexity 策略优化用于细粒度探索-开发权衡

机器学习 2026-04-16 v1

摘要

基于可验证奖励的强化学习(Reinforcement Learning with Verifiable Rewards, RLVR)推动了大语言模型(Large Language Models, LLMs)推理能力的显著进步。然而,在训练过程中有效管理探索与开发之间的权衡仍是关键挑战。本文全面分析极端困难样本和易样本在训练中的探索-开发困境,提出一种新的细粒度权衡机制。具体而言,我们引入一种解缚 Perplexity 策略,将样本空间划分为离散的探索(高 Perplexity)和开发(低 Perplexity)子空间,从而挖掘需要探索-开发权衡的细粒度样本。随后,我们提出一种双向奖励分配机制,最小化对验证奖励的影响,以实现 Perplexity 指导的探索与开发,实现更稳定的策略优化。最后,我们在两个主流任务上进行评估:数学推理和函数调用,实验结果表明所提方法优于基线,证明了在细粒度探索-开发权衡中提升 LLM 性能的有效性。

关键词

引用

@article{arxiv.2604.13902,
  title  = {DiPO: Disentangled Perplexity Policy Optimization for Fine-grained Exploration-Exploitation Trade-Off},
  author = {Xiaofan Li and Ming Yang and Zhiyuan Ma and Shichao Ma and Jintao Du and Yu Cheng and Weiqiang Wang and Zhizhong Zhang and Xin Tan and Yanyun Qu and Lizhuang Ma and Yuan Xie},
  journal= {arXiv preprint arXiv:2604.13902},
  year   = {2026}
}

备注

LLM Reinforce Learning