中文

通过基于现状损失的多智能体强化学习在序贯社会困境中诱导合作行为

人工智能 2020-02-14 v2 计算机科学与博弈论 机器学习

摘要

在社会困境情境中,个体理性会导致次优的群体结果。若干人类交互可建模为序贯(多步)社会困境。然而,与人类不同,在序贯社会困境中为优化个体奖励而训练的深度强化学习智能体会收敛于自私且相互有害的行为。我们引入了一种现状损失(SQLoss),鼓励智能体维持现状,而非反复改变其策略。我们展示了使用 SQLoss 训练的智能体如何在若干社会困境矩阵博弈中演化出合作行为。为处理具有视觉输入的社会困境博弈,我们提出了 GameDistill。GameDistill 利用自监督与聚类,从社会困境博弈中自动提取合作与自私策略。我们将 GameDistill 与 SQLoss 结合,展示了智能体如何在 Coin Game 中演化出社会期望的合作行为。

关键词

引用

@article{arxiv.2001.05458,
  title  = {Inducing Cooperative behaviour in Sequential-Social dilemmas through Multi-Agent Reinforcement Learning using Status-Quo Loss},
  author = {Pinkesh Badjatiya and Mausoom Sarkar and Abhishek Sinha and Siddharth Singh and Nikaash Puri and Jayakumar Subramanian and Balaji Krishnamurthy},
  journal= {arXiv preprint arXiv:2001.05458},
  year   = {2020}
}