中文

基于模型的强化学习在均值场游戏中并非比单智能体强化学习更难

机器学习 2024-06-04 v2 人工智能 计算机科学与博弈论 机器学习

摘要

我们研究了在均值场游戏(MFGs)中基于模型的强化学习(RL)的样本复杂度,这类方法需要战略性探索以找到纳什均衡策略。我们引入部分模型基于 Eluder 维度(P-MBED),这是一种更有效的概念来刻画模型类复杂度。值得注意的是,P-MBED 测量从给定均值场模型类转换的单智能体模型类的复杂度,潜在地可比由 \citet{huang2023statistical} 提出的 MBED 低得多个数量级。我们贡献了一个具有新颖探索策略的模型消除算法,并建立了基于 P-MBED 的多项式样本复杂度结果。关键地,我们的结果揭示了在基本可实现性和 Lipschitz 连续性假设下,\emph{在 MFGs 中学习纳什均衡的统计难度不比解决 logarithm 个数量级的单智能体 RL 问题更大。我们进一步将结果扩展到多类型 MFGs,从常规 MFGs 推广,涉及多种类型的智能体。此扩展暗示了通过均值场近似效应,更广泛类 Markov Games 的统计可行性。最后,受我们的理论算法启发,我们提出一种具有改进计算效率的启发式方法,并经实证演示其有效性。

关键词

引用

@article{arxiv.2402.05724,
  title  = {Model-Based RL for Mean-Field Games is not Statistically Harder than Single-Agent RL},
  author = {Jiawei Huang and Niao He and Andreas Krause},
  journal= {arXiv preprint arXiv:2402.05724},
  year   = {2024}
}

备注

ICML 2024; 55 Pages