中文

RLHFSpec:通过自适应草拟突破 RLHF 训练中的效率瓶颈

机器学习 2025-12-15 v2

摘要

强化学习从人类反馈(RLHF)是大型语言模型(LLM)的重要微调技术,包含生成、推理和训练三个阶段。生成阶段生成样本,然后用于推断可学习的经验进行训练。我们观察到生成阶段是整个执行过程的瓶颈,认为其是优化的关键点。具体而言,我们首次尝试将推测解码集成到 RLHF 生成阶段,提出 RLHFSpec,一个通过高效推测解码加速生成执行的 RLHF 系统,同时进行样本重新分配。为充分发挥推测解码所能提供的性能潜力,尤其是处理生成阶段的动态工作负载,RLHFSpec 提出一种 workload-aware 草拟策略选择机制,该机制通过联合考虑验证成本和接受 token 数量,选择最近的次优策略。此外,RLHFSpec 还提出了样本重新分配以充分利用 GPU 资源,并通过一种高效的样本迁移机制进行优化。实验结果表明,RLHFSpec 在生成阶段的吞吐量优于最先进的工作。此外,由于有效缓解了生成瓶颈,RLHFSpec 在整个 RLHF 执行过程中也显示出显著的性能加速。

关键词

引用

@article{arxiv.2512.04752,
  title  = {RLHFSpec: Breaking the Efficiency Bottleneck in RLHF Training via Adaptive Drafting},
  author = {Siqi Wang and Hailong Yang and Junjie Zhu and Xuezhu Wang and Yufan Xu and Depei Qian},
  journal= {arXiv preprint arXiv:2512.04752},
  year   = {2025}
}