独立学习于可表现马尔可夫潜在博弈
机器学习
2025-04-30 v1
摘要
可表现强化学习(PRL)指的是部署的策略改变底层环境的奖励和转移动力学的情形。本文通过将可表现效应纳入马尔可夫潜在博弈(MPG)来研究多智能体PRL。我们引入可表现稳定均衡(PSE)的概念,证明在合理的灵敏度假设下它必然存在。随后,我们提供了用于求解MPG的最新算法的收敛结果。具体而言,我们表明独立策略梯度上升(IPGA)和独立自然策略梯度(INPG)在最佳迭代意义上收敛到近似PSE,额外的项考虑了可表现效应。此外,我们表明INPG在最后迭代意义上收敛到PSE。当可表现效应消失时,我们恢复了之前工作中的收敛速率。对于本博弈的特殊情况,我们提供了重复再训练方法在有限时间内的最佳最后迭代收敛结果,其中智能体独立优化代理目标。我们进行大量实验以验证我们的理论发现。
引用
@article{arxiv.2504.20593,
title = {Independent Learning in Performative Markov Potential Games},
author = {Rilind Sahitaj and Paulius Sasnauskas and Yiğit Yalın and Debmalya Mandal and Goran Radanović},
journal= {arXiv preprint arXiv:2504.20593},
year = {2025}
}
备注
AISTATS 2025, code available at https://github.com/PauliusSasnauskas/performative-mpgs