SOUP:面向大语言模型的单样本混合策略强化学习
计算与语言
2026-01-30 v1
摘要
基于策略的强化学习方法(如群体相对策略优化(GRPO))在语言模型后训练中广泛应用,但常因采样多样性不足导致探索受限和早期饱和。虽然无策略数据可提供帮助,现有混合整个轨迹的方法会导致显著的策略不匹配和不稳定。在本工作中,我们提出了单样本混合策略统一范式(Single-sample Mix-policy Unified Paradigm, SOUP),该框架在样本级别统一了无策略和有策略学习。它将无策略影响限制在来自历史策略采样的序列前缀中,而序列剩余部分则采用有策略生成。通过令牌级别的重要性比率,SOUP有效地利用无策略信息,同时保持训练稳定性。大量实验表明,SOUP 在标准有策略训练以及现有无策略扩展方法中均表现出色。我们的进一步分析阐明了这种细粒度、单样本混合策略训练如何提升探索性和最终性能。
引用
@article{arxiv.2601.21476,
title = {SOUP: Token-level Single-sample Mix-policy Reinforcement Learning for Large Language Models},
author = {Lei Yang and Wei Bi and Chenxi Sun and Renren Jin and Deyi Xiong},
journal= {arXiv preprint arXiv:2601.21476},
year = {2026}
}