G-Core:一个简单、可扩展且均衡的 RLHF 训练器
机器学习
2025-08-01 v2 人工智能
摘要
从人类反馈强化学习 (RLHF) 已成为训练大型语言模型 (LLM) 和扩散模型的日益流行范式. 虽然现有的 RLHF 训练系统已取得显著进展,但常面临在多模态和扩散工作流程中扩展的挑战,以及适应动态工作负载的限制. 特别是,当前方法在处理复杂的 RLHF 管道,特别是在涉及动态抽样或生成奖励建模的情形时,可能在控制器可扩展性、灵活资源放置和高效编排方面遇到限制. 本文提出了 \textbf{G-Core},一个简单、可扩展且均衡的 RLHF 训练框架,用于解决这些挑战. G-Core 引入并行控制器编程模型, enable without 单一集中控制器的瓶颈,灵活且高效地编排复杂的 RLHF 工作流程. 此外,我们提出了动态放置模式, adaptately 分区资源并调度工作负载,显著减少硬件空闲时间并提高利用率,即使在高度可变的训练条件下也能实现. G-Core 已成功训练支持微信产品功能的模型, serve a large-scale user base, demonstrate its effectiveness and robustness in real-world scenarios. 我们的结果表明 G-Core 在 RLHF 训练方面达成了最新进展,为未来的研究和部署大规模、以人类为导向的模型提供了坚实的基础.
引用
@article{arxiv.2507.22789,
title = {G-Core: A Simple, Scalable and Balanced RLHF Trainer},
author = {Junyu Wu and Weiming Chang and Xiaotao Liu and Guanyou He and Haoqiang Hong and Boqi Liu and Hongtao Tian and Tao Yang and Yunsheng Shi and Feng Lin and Ting Yao},
journal= {arXiv preprint arXiv:2507.22789},
year = {2025}
}
备注
I haven't received company approval yet, and I uploaded it by mistake