中文

从正确的回放中学习:基于PPO的大语言模型后训练数据归因

机器学习 2026-04-03 v1

摘要

传统的强化学习算法如近端策略优化(Proximal Policy Optimization, PPO)通常在整个回放缓冲区上训练,其假设是所有生成的片段都提供有益的优化信号。然而,这些片段经常包含噪声大或不诚实的推理,这可能损害模型性能并减慢训练速度。在本文中,我们提出 Influence-Guided PPO(I-PPO),一种将数据归因集成到 RL 后训练循环中的新框架。通过使用基于梯度的近似计算每个片段的影响分数,I-PPO 识别并消除与验证梯度不一致的片段。我们的实验表明 I-PPO 一致优于 SFT 和 PPO 基线。我们表明过滤过程充当一种内在的提前停止机制,在有效减少不诚实的思维链推理的同时加速训练效率。

关键词

引用

@article{arxiv.2604.01597,
  title  = {Learning from the Right Rollouts: Data Attribution for PPO-based LLM Post-Training},
  author = {Dong Shu and Denghui Zhang and Jessica Hullman},
  journal= {arXiv preprint arXiv:2604.01597},
  year   = {2026}
}