中文

异构环境下的联邦强化学习

光学 2025-07-22 v1 最优化与控制

摘要

我们研究了一种面向环境异构性的联邦强化学习框架(FRL-EH),其中局部环境表现出统计异构性。在该框架中,代理程序通过聚合其集体经验来协作学习全局策略,同时保持其本地轨迹的隐私。为更好地反映现实场景,我们通过提出新型全局目标函数来构建稳健的FRL-EH框架。该函数专为优化确保跨异构局部环境及其合理扰动的全局策略性能而设计。我们提出一种称为FedRQ的表格型FRL算法,并对其在全局目标函数上渐近收敛于最优策略进行理论证明。此外,我们通过采用期望损失来扩展FedRQ以适用于连续状态空间,解决了在连续状态子空间上最小化价值函数的关键挑战。这一进展促进了FedRQ原则与各种深度神经网络(DNN)基于RL算法的无缝集成。广泛的实证评估表明,我们的FRL算法在多样化的异构环境中有效且稳健,始终优于现有最先进的FRL算法。

关键词

引用

@article{arxiv.2507.14489,
  title  = {Coherent Ising Machines: The Good, The Bad, The Ugly},
  author = {Farhad Khosravi and Martin Perreault and Artur Scherer and Pooya Ronagh},
  journal= {arXiv preprint arXiv:2507.14489},
  year   = {2025}
}

备注

20 pages, 14 figures