基于广义递归推理的多智能体交互有界理性建模
人工智能
2020-01-22 v2 机器学习
多智能体系统
摘要
尽管现实世界决策存在局限,多数多智能体强化学习(MARL)模型假设完全理性智能体——由于个体认知局限和/或决策问题可解性,这一性质难以满足。本文引入广义递归推理(GR2)作为一种新颖框架,对不同层级(hierarchical)理性水平的智能体建模;我们的框架使智能体展现不同水平的“思考”能力,从而允许高层级智能体对各类较不复杂的 learner 最优响应。我们在理论与实证上均有贡献。理论方面,我们通过概率图模型设计 GR2 的层级框架,并证明完美贝叶斯均衡的存在性。在 GR2 内,我们提出一种实用的 actor-critic 求解器,并通过 Lyapunov 分析证明其在双人博弈中收敛至驻点。实证方面,我们在多种 MARL 基准上验证发现。具体地,我们首先在凯恩斯选美竞赛上阐明层级思考过程,随后在正规形式博弈与协作导航基准上展示相比最先进对手建模基线的显著提升。
引用
@article{arxiv.1901.09216,
title = {Modelling Bounded Rationality in Multi-Agent Interactions by Generalized Recursive Reasoning},
author = {Ying Wen and Yaodong Yang and Rui Luo and Jun Wang},
journal= {arXiv preprint arXiv:1901.09216},
year = {2020}
}