具有约束异质性的联邦强化学习
机器学习
2024-05-07 v1 机器学习
摘要
我们研究了一个具有约束异质性的联邦强化学习(FedRL)问题。在我们的设定中,我们旨在解决一个具有多个约束的强化学习问题,同时个训练智能体位于个不同的环境中,对约束信号的访问有限,并且它们期望协作学习一个满足所有约束信号的策略。这类学习问题在大语言模型(LLM)微调和医疗应用场景中普遍存在。为解决该问题,我们提出了基于传统策略梯度方法的联邦原始-对偶策略优化方法。具体地,我们引入个局部拉格朗日函数供智能体执行局部策略更新,然后这些智能体被安排定期通信其局部策略。以自然策略梯度(NPG)和近端策略优化(PPO)作为策略优化方法,我们主要关注算法的两个实例,即FedNPG和FedPPO。我们证明FedNPG以的速率实现全局收敛,而FedPPO通过使用深度神经网络有效解决了复杂的学习任务。
引用
@article{arxiv.2405.03236,
title = {Federated Reinforcement Learning with Constraint Heterogeneity},
author = {Hao Jin and Liangyu Zhang and Zhihua Zhang},
journal= {arXiv preprint arXiv:2405.03236},
year = {2024}
}