中文

具有独立函数近似的马尔可夫博弈中的强化学习:局部访问模型下改进的样本复杂度界

机器学习 2024-03-21 v2

摘要

在一般和马尔可夫博弈中,高效学习具有大状态和动作空间的均衡,同时克服多智能体带来的维度灾难,是一个具有挑战性的问题。近期的工作尝试通过采用独立线性函数类来近似每个智能体的边际 QQ 值来解决此问题。然而,在此框架下现有的样本复杂度界对期望精度 ε\varepsilon 或动作空间的依赖是次优的。在这项工作中,我们引入了一种新算法 Lin-Confident-FTRL,用于在局部访问模拟器的条件下学习粗相关均衡(CCE),即可以在访问过的状态上与底层环境进行交互。在对状态空间大小的对数依赖下,Lin-Confident-FTRL 能够学习 ϵ\epsilon-CCE,并具有可证明的最优精度界 O(ϵ2)O(\epsilon^{-2}),且消除了对动作空间的线性依赖,同时与相关的问题参数(如智能体数量和时间范围)呈多项式规模关系。此外,我们对 Linear-Confident-FTRL 的分析推广了单智能体局部规划文献中的虚拟策略迭代技术,在假设随机访问模拟器时,产生了一种计算效率更高且样本复杂度界更紧的新算法。

关键词

引用

@article{arxiv.2403.11544,
  title  = {RL in Markov Games with Independent Function Approximation: Improved Sample Complexity Bound under the Local Access Model},
  author = {Junyi Fan and Yuxuan Han and Jialin Zeng and Jian-Feng Cai and Yang Wang and Yang Xiang and Jiheng Zhang},
  journal= {arXiv preprint arXiv:2403.11544},
  year   = {2024}
}

备注

Accepted at the 27th International Conference on Artificial Intelligence and Statistics (AISTATS 2024)