基于多智能体强化学习的隐角色随机博弈中歧义身份分类
人工智能
2023-03-07 v2
摘要
多智能体强化学习(MARL)是一种求解随机博弈的普遍学习范式。在大多数 MARL 研究中,博弈中的智能体被预先定义为队友或敌人,且智能体间关系在整局博弈中保持固定。然而在现实问题中,智能体关系通常事先未知或动态变化。许多多方交互一开始就提出:谁与我是同一队?无论初入证券交易所还是幼儿园,这一问题都会浮现。因此,面对不完美信息与歧义身份,为此类情形训练策略是一个亟待解决的重要问题。本工作中,我们提出一种新颖的身份检测强化学习(IDRL)框架,使智能体能够动态推断邻近智能体身份并选取恰当策略以完成任务。在 IDRL 框架中,构建关系网络以通过观察智能体行为来推断其他智能体身份;优化危险网络以估计误判风险。此外,我们提出一种内在奖励,平衡最大化外部奖励与准确识别的需求。在辨识出智能体间合作-竞争模式后,IDRL 应用现有 MARL 方法之一学习策略。为评估所提方法,我们在 Red-10 出牌博弈上开展实验,结果表明 IDRL 优于其他最先进的 MARL 方法。令人印象深刻的是,关系网络识别智能体身份的性能可与顶尖人类玩家比肩;危险网络合理规避了不完美识别的风险。复现所有报告结果的代码可在 https://github.com/MR-BENjie/IDRL 在线获取。
引用
@article{arxiv.2210.12896,
title = {Classifying Ambiguous Identities in Hidden-Role Stochastic Games with Multi-Agent Reinforcement Learning},
author = {Shijie Han and Siyuan Li and Bo An and Wei Zhao and Peng Liu},
journal= {arXiv preprint arXiv:2210.12896},
year = {2023}
}