中文

用强化学习与基于图的以牙还牙应对非对称与环形序贯社会困境

人工智能 2022-06-28 v1 计算机科学与博弈论

摘要

在许多社会与工业交互中,参与者通常偏好纯粹自身利益而牺牲全局福祉。作为社会困境,这类非合作博弈提供了如下情境:多个行动者皆应合作以达最佳结果,但贪婪与恐惧导致最差的利己问题。近来深度强化学习(RL)的出现因序贯社会困境(SSD)的引入重新激发了社会困境的研究兴趣。混合 RL 策略与以牙还牙(TFT)策略的合作智能体已成功解决一些非最优纳什均衡问题。然而,此类范式要求行动者间对称且直接的合作,而当相互合作变为非对称且仅能以至少第三方参与的环形方式实现时,这些条件不再满足。为解决该问题,本文将 SSD 扩展为环形序贯社会困境(CSSD),一种能更好泛化智能体间合作多样性的新型马尔可夫博弈。其次,为应对此类环形与非对称合作,我们提出基于 RL 策略与图基 TFT 的候选方案。我们在提供可调合作结构的简单多人网格世界上进行了实验。我们的工作证实,图基方法通过鼓励利己智能体达成相互合作,有益于解决环形情境。

关键词

引用

@article{arxiv.2206.12909,
  title  = {Tackling Asymmetric and Circular Sequential Social Dilemmas with Reinforcement Learning and Graph-based Tit-for-Tat},
  author = {Tangui Le Gléau and Xavier Marjou and Tayeb Lemlouma and Benoit Radier},
  journal= {arXiv preprint arXiv:2206.12909},
  year   = {2022}
}