亲社会学习智能体比自私智能体更好地解决广义猎鹿博弈
人工智能
2017-12-11 v2 计算机科学与博弈论
摘要
深度强化学习已成为构建能够进入复杂多智能体情境并通过经验改进策略的智能体的重要范式。一种常用技术是反应式训练——将标准强化学习方法应用于学习者的环境,同时将其他智能体视为环境的一部分。众所周知,在一般和博弈中,反应式训练可能导致智能体群体收敛到低效的结果。我们关注一类这样的环境:猎鹿博弈。在此类博弈中,智能体要么选择有风险的合作策略(如果双方都选择则获得高回报,但单独尝试的智能体获得低回报),要么选择安全策略(无论其他智能体如何都获得安全回报)。我们询问如何改变单个智能体的学习规则以改善其在包含其他反应式学习者的猎鹿博弈中的结果。我们扩展了多智能体强化学习中奖励塑造的现有工作,并表明使单个智能体变得亲社会,即让其关心伙伴的奖励,可以增加群体收敛到良好结果的概率。因此,即使我们只控制群体中的一个智能体,使其亲社会也能增加我们智能体的长期回报。我们通过实验表明,这一结果适用于各种具有猎鹿博弈动力学的更复杂环境,包括智能体必须从原始输入像素中学习的环境。
引用
@article{arxiv.1709.02865,
title = {Prosocial learning agents solve generalized Stag Hunts better than selfish ones},
author = {Alexander Peysakhovich and Adam Lerer},
journal= {arXiv preprint arXiv:1709.02865},
year = {2017}
}