中文

针对特定一般和随机博弈的多智能体逆强化学习

机器学习 2021-01-01 v3 计算机科学与博弈论 机器学习

摘要

本文解决了双人一般和随机博弈框架中的多智能体逆强化学习(MIRL)问题。考虑了五种MIRL变体:uCS-MIRL、advE-MIRL、cooE-MIRL、uCE-MIRL和uNE-MIRL,每种由其解概念区分。问题uCS-MIRL是一个合作博弈,其中智能体采用旨在最大化总博弈值的合作策略。在问题uCE-MIRL中,假设智能体遵循构成相关均衡的策略,同时最大化总博弈值。问题uNE-MIRL在总博弈值最大化方面与uCE-MIRL类似,但假设智能体在玩纳什均衡。问题advE-MIRL和cooE-MIRL分别假设智能体在玩对抗均衡和协调均衡。我们提出了新颖的方法来解决这五个问题,假设博弈观察者已知或能够准确估计参与者的策略与解概念。对于uCS-MIRL,我们首先开发一组特征解,确保观察到的双策略是一个uCS,然后应用贝叶斯逆学习方法。对于uCE-MIRL,我们构建一个线性规划问题,其约束定义了观察到的策略为相关均衡的充要条件。目标是选择一个解,不仅最小化观察到的双策略与局部uCS之间的总博弈值差异,还最大化解的尺度。我们对uNE-MIRL问题应用了类似处理。其余两个问题可通过利用解的唯一性并建立凸优化问题来高效求解。结果在各种基准网格世界博弈上得到验证。

关键词

引用

@article{arxiv.1806.09795,
  title  = {Multi-agent Inverse Reinforcement Learning for Certain General-sum Stochastic Games},
  author = {Xiaomin Lin and Stephen C. Adams and Peter A. Beling},
  journal= {arXiv preprint arXiv:1806.09795},
  year   = {2021}
}

备注

30 pages