FORLER:基于 Q-ensemble 与 Actor Rectification 的联邦离线强化学习
机器学习
2026-02-03 v1 人工智能
摘要
在物联网系统中,联邦学习已通过使在线强化学习(RL)实现并行策略训练而获得进展,这无需共享原始数据。然而,与实时环境交互可能具有风险和高昂成本,这促使离线联邦 RL(FRL)的出现,即局部设备从固定数据集中学习。尽管其前景广阔,但离线 FRL 在数据质量低且异构的情况下可能崩溃。离线 RL 容易陷入局部最优解,而在 FRL 中,一个次优策略的设备可能会降低聚合模型,即策略污染。我们提出了 FORLER,通过在服务器端进行 Q-ensemble 汇聚与在设备端进行 Actor Rectification 来实现这一目标。服务器端能健壮地合并设备 Q 函数,以抑制策略污染,并将重计算卸载到资源受限的硬件上而不妥协隐私。局部方面,Actor Rectification 通过对高-Q 动作进行零阶搜索来丰富策略梯度,并引入专用的正则化器以引导策略朝向这些动作。我们进一步提供了安全策略改进性能保证。大量实验表明,在数据质量和异构性方面存在各种情况时,FORLER 始终优于强大的基线方法。
引用
@article{arxiv.2602.02055,
title = {FORLER: Federated Offline Reinforcement Learning with Q-Ensemble and Actor Rectification},
author = {Nan Qiao and Sheng Yue},
journal= {arXiv preprint arXiv:2602.02055},
year = {2026}
}
备注
accetped by IEEE International Conference on Communications (ICC 2026)