混合动机强化学习中的社会多样性与社会偏好
多智能体系统
2020-02-14 v2 人工智能
摘要
近期关于纯冲突与纯共同利益博弈中强化学习的研究强调了群体异质性的重要性。相比之下,混合动机博弈中强化学习的研究主要依赖同质化方法。鉴于混合动机博弈的定义性特征——群体成员间激励的不完全相关——我们研究群体异质性对混合动机强化学习的影响。我们借鉴社会心理学中的相互依赖理论,赋予强化学习智能体以社会价值取向(SVO),这是对群体结果分布偏好的一种灵活形式化。随后我们在两个混合动机马尔可夫博弈中探究SVO多样性对强化学习智能体群体的影响。我们证明SVO的异质性产生了有意义且复杂的行为变异,类似于相互依赖理论所暗示的。在这些混合动机困境中的实证结果表明,在异质群体中训练的智能体相对于在同质群体中训练的智能体,发展出了特别泛化且高性能的策略。
引用
@article{arxiv.2002.02325,
title = {Social diversity and social preferences in mixed-motive reinforcement learning},
author = {Kevin R. McKee and Ian Gemp and Brian McWilliams and Edgar A. Duéñez-Guzmán and Edward Hughes and Joel Z. Leibo},
journal= {arXiv preprint arXiv:2002.02325},
year = {2020}
}
备注
Proceedings of the 19th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2020)