具有一般函数近似的 Markov 博弈离线学习
机器学习
2023-02-07 v1 人工智能
多智能体系统
机器学习
摘要
我们研究 Markov 博弈中的离线多智能体强化学习(RL),其目标是从预先从博弈中收集的离线数据集中学习近似均衡——如 Nash 均衡和(粗)相关均衡。现有工作考虑相对受限的表格模型或线性模型,并分别处理每种均衡。在本研究中,我们首次为一般函数近似下 Markov 博弈中的样本高效离线学习提供了框架,以统一的方式处理所有 3 种均衡。通过使用 Bellman 一致悲观主义,我们获得了策略回报的区间估计,并利用上界和下界对候选策略的间隙进行松弛,以此作为我们的优化目标。我们的结果推广了先前的工作并提供了若干额外见解。重要的是,我们要求数据覆盖条件改进了近期提出的“单侧 concentrability”。我们的条件允许对偏离策略进行选择性覆盖,从而在其贪婪性(作为近似最佳响应)与覆盖之间实现最优权衡,并且我们展示了由此带来显著更好保证的场景。作为一种新联系,我们还展示了我们的算法框架如何包含看似不同、专为两人零和博弈特例设计的解概念。
引用
@article{arxiv.2302.02571,
title = {Offline Learning in Markov Games with General Function Approximation},
author = {Yuheng Zhang and Yu Bai and Nan Jiang},
journal= {arXiv preprint arXiv:2302.02571},
year = {2023}
}