FOVA:基于混合质量数据的数据离线联邦强化学习
机器学习
2025-12-03 v1 人工智能
摘要
数据离线联邦强化学习 (FRL) 将联邦学习与离线强化学习结合,近日受到广泛关注。尽管已有一些进展,但大多数现有离线 FRL 方法在面对混合质量数据时性能会急剧下降,即日志行为 (离线数据) 由跨客户端策略质量参差不齐的策略收集。为此,本文引入一种新的基于投票的数据离线 FRL 框架,命名为 FOVA。它利用“投票机制”在本地策略评估期间识别高回报动作,从而减轻来自各本地学习策略中低质量行为的负面影响。此外,基于优势加权回归 (AWR),我们构建一致的本地和全局训练目标,显著提升 FOVA 的效率和稳定性。进一步的理论分析表明,FOVA 学习的策略相对于行为策略具有严格的策略改进。大量实验验证了我们提出的算法在广泛使用的基准数据集上的显著性能提升。
关键词
引用
@article{arxiv.2512.02350,
title = {FOVA: Offline Federated Reinforcement Learning with Mixed-Quality Data},
author = {Nan Qiao and Sheng Yue and Ju Ren and Yaoxue Zhang},
journal= {arXiv preprint arXiv:2512.02350},
year = {2025}
}
备注
Accepted by IEEE/ACM ToN