中文

平均场博弈中沿单一样本路径的无预言机强化学习

机器学习 2023-04-12 v3 计算机科学与博弈论 多智能体系统

摘要

我们考虑平均场博弈(MFGs)中的在线强化学习。与传统方法不同,我们缓解了平均场预言机的需要,通过开发一种利用通用智能体单一样本路径逼近平均场均衡(MFE)的算法。我们称之为{\it Sandbox Learning}(沙盒学习),因为它可用作多智能体非合作设定中任何智能体学习的预热启动。我们采用双时间尺度方法,其中平均场的在线不动点递归在较慢时间尺度上运行,与通用智能体在较快时间尺度上的控制策略更新相配合。给定智能体的底层马尔可夫决策过程(MDP)是连通的,我们提供了有限样本收敛保证,即平均场与控制策略收敛到平均场均衡。Sandbox 学习算法的样本复杂度为 O~(ϵ4)\tilde{\mathcal{O}}(\epsilon^{-4}),其中 ϵ\epsilon 为 MFE 逼近误差。这与假设可访问预言机的工作类似。最后,我们在多样场景中实证展示了沙盒学习算法的有效性,包括 MDP 不一定具有单一连通类的情况。

关键词

引用

@article{arxiv.2208.11639,
  title  = {Oracle-free Reinforcement Learning in Mean-Field Games along a Single Sample Path},
  author = {Muhammad Aneeq uz Zaman and Alec Koppel and Sujay Bhatt and Tamer Başar},
  journal= {arXiv preprint arXiv:2208.11639},
  year   = {2023}
}

备注

Accepted for publication in AISTATS 2023