Omni-Thinker:基于混合奖励与任务调度扩展多任务强化学习于大语言模型
机器学习
2025-09-30 v3 人工智能
摘要
通用人工智能的 pursuit 取决于能够处理结构化推理与开放式生成的大语言模型 (LLMs)。我们提出 Omni-Thinker,一个统一的强化学习 (RL) 框架,通过融合混合奖励与 backward-transfer-guided 调度,实现对 LLMs 的跨任务扩展。混合奖励将基于规则的可验证信号与来自 LLM-as-a-Judge 的偏好评估相结合,使模型既能在确定性领域又能在主观性领域进行学习。我们的调度器依据准确率 backward transfer (BWT) 对任务进行排序,降低遗忘现象并提升多任务性能。实验覆盖四个领域,显示出在联合训练中提升 6.2%,在模型合并中提升 12.4%。此外,我们证明简单关于准确率 transfer 的假设可准确预测课程结果,熵动力学解释因生成性任务导致的偏差。这些发现凸显了 BWT-aware 调度与混合监督在扩展基于 RL 的后训练 toward general-purpose LLMs 中的重要性。
引用
@article{arxiv.2507.14783,
title = {Omni-Thinker: Scaling Multi-Task RL in LLMs with Hybrid Reward and Task Scheduling},
author = {Derek Li and Jiaming Zhou and Leo Maxime Brunswic and Abbas Ghaddar and Qianyi Sun and Liheng Ma and Yu Luo and Dong Li and Mark Coates and Jianye Hao and Yingxue Zhang},
journal= {arXiv preprint arXiv:2507.14783},
year = {2025}
}