高效政策优化的动态双层下采样框架
机器学习
2025-09-29 v1 人工智能
摘要
批判性无关方法如 GRPO 通过从多个 rollout 估计 advantage 来降低内存需求,但倾向于收敛缓慢,因为关键学习信号被大量无信息样本和标记稀释。为解决此挑战,我们提出了 Dynamic Dual-Level Down-Sampling (DS) 框架,通过优先选择样本和标记中最具信息性的样本和标记来提高政策优化的效率。DS 在两个层面上运行:(1) 样本层级,选取子集 rollout 以最大化 advantage variance ()。我们理论证明,这种选择与政策梯度范数上界正相关,产生更大的政策梯度。(2) 标记层级,优先选择 的乘积较大的标记,聚焦于政策既不确定又具有影响力的标记上的更新。此外,为防止对高信噪信号数据过拟合,DS 采用受课程学习启发的动态下采样计划。该计划在早期采用激进下采样以加速学习,逐渐放宽以促进稳健的泛化。广泛的实验在 Qwen2.5 和 Llama3.1 上表明,将 DS 集成到先进的 RL 算法中,能够在 diverse reasoning benchmarks 中以更少的样本和标记实现最先进的性能和泛化。我们的代码已包含在补充材料中并将公开提供。
引用
@article{arxiv.2509.22115,
title = {Learning More with Less: A Dynamic Dual-Level Down-Sampling Framework for Efficient Policy Optimization},
author = {Chao Wang and Tao Yang and Hongtao Tian and Yunsheng Shi and Qiyao Ma and Xiaotao Liu and Ting Yao and Wenbo Ding},
journal= {arXiv preprint arXiv:2509.22115},
year = {2025}
}
备注
18 pages, 5 figures, Under review as a conference paper at ICLR 2026