带线性函数逼近的 Nash Q-learning 的有限样本保证
机器学习
2023-03-02 v1 人工智能
摘要
Nash Q-learning 可被视为多智能体强化学习(MARL)中最早且最知名的一类算法,用于学习构成底层一般和 Markov 博弈纳什均衡的策略。其原始证明针对表格情形提供了渐近保证。近来,针对表格情形利用更现代的 RL 技术已给出有限样本保证。我们的工作分析了采用线性函数逼近的 Nash Q-learning——一种在状态空间庞大或连续时引入的表示机制——并提供了表明其样本效率的有限样本保证。我们发现,所得性能几乎匹配同一表示下已有的单智能体 RL 高效结果,且与表格情形下已知最优结果相比存在多项式差距。
引用
@article{arxiv.2303.00177,
title = {Finite-sample Guarantees for Nash Q-learning with Linear Function Approximation},
author = {Pedro Cisneros-Velarde and Sanmi Koyejo},
journal= {arXiv preprint arXiv:2303.00177},
year = {2023}
}
备注
25 pages. arXiv admin note: text overlap with arXiv:2205.15891