中文

分析对手塑造的样本复杂度

机器学习 2024-02-09 v1 人工智能 计算机科学与博弈论 多智能体系统

摘要

在一般和博弈中的学习往往会产生集体次优的结果。为解决这一问题,对手塑造(OS)方法主动引导其他智能体的学习过程,实证表明这在许多场景下能改善个体和群体的性能。早期的 OS 方法使用高阶导数来塑造共同玩家的学习,使其不适用于多步学习塑造。后续工作“无模型对手塑造”(M-FOS)通过将 OS 问题重构为元博弈来解决这些问题。与早期 OS 方法相比,人们对 M-FOS 框架的理论理解甚少。为 M-FOS 提供理论保证十分困难,因为 A) 关于元强化学习理论样本复杂度界的文献很少;B) M-FOS 在连续状态和动作空间中运行,使得理论分析具有挑战性。在这项工作中,我们提出了 R-FOS,这是 M-FOS 的一个表格化版本,更适合理论分析。R-FOS 将连续元博弈 MDP 离散化为表格 MDP。在这个离散化的 MDP 中,我们采用了 RmaxR_{max} 算法(最常用于推导 MDP 的 PAC 界)作为 R-FOS 算法中的元学习器。我们推导出了一个样本复杂度界,该界关于内部状态和动作空间的基数以及智能体数量呈指数关系。我们的界保证,以高概率,R-FOS 智能体学到的最终策略接近最优策略,仅相差一个常数因子。最后,我们研究了 R-FOS 的样本复杂度如何随状态 - 动作空间的大小缩放。我们在匹配便士环境中的实证结果支持了我们要关于缩放的理论结果。

关键词

引用

@article{arxiv.2402.05782,
  title  = {Analysing the Sample Complexity of Opponent Shaping},
  author = {Kitty Fung and Qizhen Zhang and Chris Lu and Jia Wan and Timon Willi and Jakob Foerster},
  journal= {arXiv preprint arXiv:2402.05782},
  year   = {2024}
}