中文

基于分布式评论正则化的联邦分布式强化学习

机器学习 2026-03-19 v1

摘要

联邦强化学习通常通过参数平均来聚合价值函数或策略,这强调期望回报,可能掩盖在安全关键环境中重要的统计多模态性和尾部行为。我们形式化了联邦分布式强化学习(FedDistRL),其中客户端对分位值函数评论家进行参数化,并仅进行网络联邦。我们还提出了TR-FedDistRL,该方法在每个客户端上构建一个基于风险感知的Wasserstein 重心,以时间缓冲区为基础。这种局部重心提供了一个参考区域来约束参数平均评论家,确保在联邦过程中不会平均掉必要的分布信息。在固定策略评估下,可行图在探测集Wasserstein度量下为非扩张且更新为收缩。实验在bandit、多智能体网格世界和连续高速公路环境上显示,相对于以均值导向和非联邦基线,方法在减少均值饱和、改进安全代理(灾难/事故率)和降低评论家/策略漂移方面表现更佳。

关键词

引用

@article{arxiv.2603.17820,
  title  = {Federated Distributional Reinforcement Learning with Distributional Critic Regularization},
  author = {David Millard and Cecilia Alm and Rashid Ali and Pengcheng Shi and Ali Baheri},
  journal= {arXiv preprint arXiv:2603.17820},
  year   = {2026}
}

备注

9 pages, 4 Figures, conference