PubSwap:用于联邦RLVR的公共数据离策略协调
机器学习
2026-04-15 v1
摘要
使用可验证奖励进行强化学习(RLVR)的推理后训练通常在集中式设置中进行研究,然而许多实际应用涉及分布在各个组织间的去中心化私有数据。联邦训练是一种自然的解决方案,但在此模式下扩展RLVR具有挑战性:全模型同步代价高昂,并且在异构数据下执行大量本地步骤可能导致严重的客户端漂移。我们提出了一种联邦RLVR框架,该框架结合了基于LoRA的本地适应和基于公共数据的离策略步骤,以提高通信效率和跨客户端协调。特别是,使用一个小的共享公共数据集,定期跨组织交换和重用响应级别的训练信号,为更全局对齐的目标提供了一个轻量级锚点,同时不暴露私有数据。我们的方法在公共数据步骤期间,选择性地用全局正确的响应替换本地不正确的响应,从而使训练更接近本地策略,同时仍然受益于跨客户端协调。在数学和医学推理基准及模型上,我们的方法始终优于标准基线。我们的结果突出了一个简单有效的联邦推理后训练方案:结合低秩通信与有限的公共数据协调。
引用
@article{arxiv.2604.12160,
title = {PubSwap: Public-Data Off-Policy Coordination for Federated RLVR},
author = {Anupam Nayak and Baris Askin and Muhammed Ustaomeroglu and Carlee Joe-Wong and Gauri Joshi},
journal= {arXiv preprint arXiv:2604.12160},
year = {2026}
}