中文

基于 TD 误差聚合的协作式 Actor-Critic

系统与控制 2022-07-27 v1 机器学习 系统与控制

摘要

在去中心化协作多智能体强化学习中,智能体可相互聚合信息以学习最大化团队平均目标函数的策略。尽管各智能体愿意与他人协作,但由于隐私问题,它们可能不愿直接共享关于局部状态、奖励和值函数的信息。本工作中,我们引入一种具有 TD 误差聚合的去中心化 actor-critic 算法,该算法不违反隐私问题,并假设通信信道存在时延与丢包。我们为做出此类弱假设所付出的代价是每智能体通信负担的增加(以传输数据维度衡量)。有趣的是,通信负担仅随图规模呈二次增长,这使得该算法可应用于大型网络。我们在递减步长下提供收敛性分析,以验证智能体最大化团队平均目标函数。

关键词

引用

@article{arxiv.2207.12533,
  title  = {Cooperative Actor-Critic via TD Error Aggregation},
  author = {Martin Figura and Yixuan Lin and Ji Liu and Vijay Gupta},
  journal= {arXiv preprint arXiv:2207.12533},
  year   = {2022}
}