基于近似行为度量的状态投影用于联邦强化学习
机器学习
2025-05-16 v1
摘要
联邦强化学习(FRL)方法通常共享加密的局部状态或策略信息,帮助各客户端在保护隐私的同时互相学习。在本工作中,我们提出共享近似行为度量驱动的状态投影函数是提升FRL性能并同时有效保护敏感信息的有前景途径。我们引入FedRAG,一个FRL框架,用于为每个客户端学习计算可行的状态投影函数,并在中心服务器上聚合投影函数的参数。FedRAG方法不共享敏感的任务特定信息,同时为每个客户端提供信息增益。我们在DeepMind Control Suite上进行了广泛实验以展示富有洞察力的结果。
引用
@article{arxiv.2505.09959,
title = {Approximated Behavioral Metric-based State Projection for Federated Reinforcement Learning},
author = {Zengxia Guo and Bohui An and Zhongqi Lu},
journal= {arXiv preprint arXiv:2505.09959},
year = {2025}
}