中文

具有对手学习感知的近端学习

机器学习 2022-10-20 v1 人工智能 多智能体系统

摘要

具有对手学习感知的学习(LOLA)(Foerster 等人 [2018a])是一种多智能体强化学习算法,通常在部分竞争环境中学习基于互惠的合作。然而,LOLA 经常在由神经网络参数化的更复杂策略空间上无法学习此类行为,部分原因是更新规则对策略参数化敏感。这个问题在对手建模设定中尤为明显,其中对手的策略未知且必须从观测中推断;在此类设定中,LOLA 是病态定义的,因为行为等价的对手策略可能导致非等价的更新。为解决这一缺陷,我们将 LOLA 重新解释为对近端算子的近似,然后推导出一种新的算法——近端 LOLA(POLA),它直接使用近端公式。与 LOLA 不同,POLA 更新是参数化不变的,即在近端目标具有唯一最优解的意义下,行为等价的策略导致行为等价的更新。接着我们给出理想 POLA 更新的实用近似,并在多个具有函数近似和对手建模的部分竞争环境中进行评估。这经验性地表明,POLA 比 LOLA 更可靠地实现基于互惠的合作。

关键词

引用

@article{arxiv.2210.10125,
  title  = {Proximal Learning With Opponent-Learning Awareness},
  author = {Stephen Zhao and Chris Lu and Roger Baker Grosse and Jakob Nicolaus Foerster},
  journal= {arXiv preprint arXiv:2210.10125},
  year   = {2022}
}

备注

24 pages (10 pages main paper), 5 figures, to be published in 36th Conference on Neural Information Processing Systems (NeurIPS 2022)