马尔可夫势博弈中的独立与去中心化学习
机器学习
2025-04-02 v8 人工智能
计算机科学与博弈论
多智能体系统
系统与控制
系统与控制
摘要
我们研究了一种多智能体强化学习动态,并分析了其在无限时域折扣马尔可夫势博弈中的渐近行为。我们关注独立与去中心化设定,其中参与者不知道博弈参数,且无法通信或协调。在每个阶段,参与者以异步方式根据其实现的一次性奖励更新其对评估其总或有收益的 Q 函数的估计。然后,参与者基于估计的 Q 函数,通过引入最优一次性偏离策略独立更新其策略。受单智能体强化学习中 actor-critic 算法的启发,我们学习动态的一个关键特征是智能体以比策略更快的时间尺度更新其 Q 函数估计。利用双时间尺度异步随机逼近理论中的工具,我们刻画了学习动态的收敛集。
引用
@article{arxiv.2205.14590,
title = {Independent and Decentralized Learning in Markov Potential Games},
author = {Chinmay Maheshwari and Manxi Wu and Druv Pai and Shankar Sastry},
journal= {arXiv preprint arXiv:2205.14590},
year = {2025}
}
备注
43 pages, 1 figure