中文

具有约束异质性的联邦强化学习

机器学习 2024-05-07 v1 机器学习

摘要

我们研究了一个具有约束异质性的联邦强化学习(FedRL)问题。在我们的设定中,我们旨在解决一个具有多个约束的强化学习问题,同时NN个训练智能体位于NN个不同的环境中,对约束信号的访问有限,并且它们期望协作学习一个满足所有约束信号的策略。这类学习问题在大语言模型(LLM)微调和医疗应用场景中普遍存在。为解决该问题,我们提出了基于传统策略梯度方法的联邦原始-对偶策略优化方法。具体地,我们引入NN个局部拉格朗日函数供智能体执行局部策略更新,然后这些智能体被安排定期通信其局部策略。以自然策略梯度(NPG)和近端策略优化(PPO)作为策略优化方法,我们主要关注算法的两个实例,即FedNPG和FedPPO。我们证明FedNPG以O~(1/T)\tilde{O}(1/\sqrt{T})的速率实现全局收敛,而FedPPO通过使用深度神经网络有效解决了复杂的学习任务。

关键词

引用

@article{arxiv.2405.03236,
  title  = {Federated Reinforcement Learning with Constraint Heterogeneity},
  author = {Hao Jin and Liangyu Zhang and Zhihua Zhang},
  journal= {arXiv preprint arXiv:2405.03236},
  year   = {2024}
}