RLHFless:用于高效 RLHF 的无服务器计算
人工智能
2026-02-27 v1 分布式、并行与集群计算
摘要
强化学习从人类反馈(RLHF)已被广泛应用于大型语言模型(LLM)的后训练,以对齐模型输出与人类偏好。最近的模型,如 DeepSeek-R1,还表明 RLHF 有潜力提高 LLM 在复杂任务上的推理能力。在强化学习中,推断与训练同时存在,导致整个工作流程中资源需求的动态变化。与传统 RL 相比,RLHF 由于模型规模扩大和资源消耗,进一步挑战训练效率。Several RLHF 框架旨在平衡灵活的抽象与高效执行。然而,它们依赖服务器式基础设施,难以应对细粒度的资源波动。结果在同步 RLHF 训练期间,RL 组件之间或组件内部的空闲时间常导致开销和资源浪费。为解决这些问题,我们提出了 RLHFless,这是第一个用于同步 RLHF 的可扩展训练框架,构建在无服务器计算环境上。RLHFless 适应 RLHF 流程中动态的资源需求,预计算共享前缀以避免重复计算,并使用考虑响应长度变化的成本感知 actor 扩展策略,在更低成本和更高速度之间找到平衡点。此外,RLHFless 将工作负载有效分配给减少函数内部不平衡和空闲时间。在物理测试环境和大规模模拟集群上的实验表明,RLHFless 相对于最先进的基线实现了最高 1.35 倍的加速和 44.8% 的成本降低。
引用
@article{arxiv.2602.22718,
title = {RLHFless: Serverless Computing for Efficient RLHF},
author = {Rui Wei and Hanfei Yu and Shubham Jain and Yogarajan Sivakumar and Devesh Tiwari and Jian Li and Seung-Jong Park and Hao Wang},
journal= {arXiv preprint arXiv:2602.22718},
year = {2026}
}