CAESAR: 通过收敛感知采样与筛选增强异构MDP中的联邦强化学习
机器学习
2024-04-18 v2 人工智能
摘要
在本研究中,我们深入探讨了在跨不同马尔可夫决策过程(MDP)运行的价值基智能体背景下的联邦强化学习(FedRL)。现有的FedRL方法通常通过对智能体的价值函数进行平均来聚合其学习,以提升性能。然而,这种聚合策略在异构环境中是次优的,因为智能体会收敛到不同的最优价值函数。为解决此问题,我们引入了带有筛选的收敛感知采样(CAESAR)聚合方案,旨在增强单个智能体在不同MDP中的学习。CAESAR是一种由服务器使用的聚合策略,它结合了收敛感知采样与筛选机制。通过利用在相同MDP中学习的智能体收敛到相同最优价值函数这一事实,CAESAR能够选择性地吸收来自更熟练同行的知识,从而显著提升整体学习效率。我们使用自定义的GridWorld环境和经典的FrozenLake-v1任务(每个任务都呈现不同程度的异构性)实证验证了我们的假设,并展示了CAESAR在提升智能体学习效率方面的有效性。
引用
@article{arxiv.2403.20156,
title = {CAESAR: Enhancing Federated RL in Heterogeneous MDPs through Convergence-Aware Sampling with Screening},
author = {Hei Yi Mak and Flint Xiaofeng Fan and Luca A. Lanzendörfer and Cheston Tan and Wei Tsang Ooi and Roger Wattenhofer},
journal= {arXiv preprint arXiv:2403.20156},
year = {2024}
}