Omni-Modal Post-Training强化学习引擎Relax
摘要
强化学习(RL)后训练已被证明在大型语言模型中有效地 unlocking推理、自省和工具使用能力。随着模型扩展到omni-modal输入和agentic多轮工作流程,RL训练系统面临三个相互依赖的挑战:异构数据流、规模化的 operational鲁棒性以及staleness与throughput之间的权衡。我们提出了Relax(强化学习引擎 利用 Agentic X-modality),一个开源RL训练引擎,通过三个协同设计的架构层来解决这些挑战。首先,一种omni-native架构将多模态支持嵌入整个堆栈——从数据预处理和模态感知并行处理到推理生成,而不是在以文本为中心的管道上进行改造。其次,每个RL角色以独立、容错隔离的服务形式运行,可以在无需全局协调的情况下进行比例扩容、恢复和升级。第三,服务级别的解耦通过TransferQueue数据总线实现异步训练,其中单个staleness参数在on-policy、near-on-policy和fully异步执行之间平滑插值。Relax在Qwen3-4B上的on-policy训练中实现了1.20倍的端到端加速。其完全异步模式在Qwen3-4B上比colocate快1.76倍,在Qwen3-Omni-30B上快2.00倍,所有模式都收敛到相同的奖励水平。Relax支持R3(Rollout Routing Replay)对MoE模型仅需1.9%的开销,而veRL在相同配置下会出现32%的性能下降。它进一步在Qwen3-Omni上实现了稳定的omni-modal RL收敛,支持image、text和audio,持续超过2,000步video而不出现性能下降。Relax可在https://github.com/rednote-ai/Relax获取。
引用
@article{arxiv.2604.11554,
title = {Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale},
author = {Liujie Zhang and Benzhe Ning and Rui Yang and Xiaoyan Yu and Jiaxing Li and Lumeng Wu and Jia Liu and Minghao Li and Weihang Chen and Weiqi Hu and Lei Zhang},
journal= {arXiv preprint arXiv:2604.11554},
year = {2026}
}
备注
17 pages, 22 figures