具有独立函数近似的马尔可夫博弈中的强化学习:局部访问模型下改进的样本复杂度界
机器学习
2024-03-21 v2
摘要
在一般和马尔可夫博弈中,高效学习具有大状态和动作空间的均衡,同时克服多智能体带来的维度灾难,是一个具有挑战性的问题。近期的工作尝试通过采用独立线性函数类来近似每个智能体的边际 值来解决此问题。然而,在此框架下现有的样本复杂度界对期望精度 或动作空间的依赖是次优的。在这项工作中,我们引入了一种新算法 Lin-Confident-FTRL,用于在局部访问模拟器的条件下学习粗相关均衡(CCE),即可以在访问过的状态上与底层环境进行交互。在对状态空间大小的对数依赖下,Lin-Confident-FTRL 能够学习 -CCE,并具有可证明的最优精度界 ,且消除了对动作空间的线性依赖,同时与相关的问题参数(如智能体数量和时间范围)呈多项式规模关系。此外,我们对 Linear-Confident-FTRL 的分析推广了单智能体局部规划文献中的虚拟策略迭代技术,在假设随机访问模拟器时,产生了一种计算效率更高且样本复杂度界更紧的新算法。
引用
@article{arxiv.2403.11544,
title = {RL in Markov Games with Independent Function Approximation: Improved Sample Complexity Bound under the Local Access Model},
author = {Junyi Fan and Yuxuan Han and Jialin Zeng and Jian-Feng Cai and Yang Wang and Yang Xiang and Jiheng Zhang},
journal= {arXiv preprint arXiv:2403.11544},
year = {2024}
}
备注
Accepted at the 27th International Conference on Artificial Intelligence and Statistics (AISTATS 2024)