中文

面向异构仿真环境中基于个性化观察归一化的联邦强化学习

机器学习 2026-05-28 v1 人工智能

摘要

联邦强化学习(FedRL)通过使多个智能体在不共享原始数据的情况下协同训练全局策略,适用于隐私敏感的应用场景。然而,在异构环境中,由于不同的状态转动力学导致输入分布不一致以及聚合过程中的参数更新不平衡,FedRL面临挑战。因此,本文开发了一种个性化观察归一化(PON)方法,使每个智能体能够使用持续更新的运行均值和方差对原始状态输入进行局部归一化。该设计确保了局部特征的一致尺度缩放,而在聚合过程中不会被其他智能体所超越。进一步我们表明,由于本地输入分布的多样性,跨智能体共享归一化参数是无效的,这凸显了个性化统计数据不可或缺性。在异构MuJoCo任务上的实验表明,我们开发的PON方法加快了训练速度,并优于基线方法实现了卓越的性能。

关键词

引用

@article{arxiv.2605.27385,
  title  = {Personalized Observation Normalization for Federated Reinforcement Learning in Simulation Environments with Heterogeneity},
  author = {Yiran Pang and Zhen Ni and Xiangnan Zhong},
  journal= {arXiv preprint arXiv:2605.27385},
  year   = {2026}
}

备注

Accepted at the International Joint Conference on Neural Networks (IJCNN) 2025