约束马尔可夫势博弈中纳什策略的可证明学习
机器学习
2023-06-14 v1 计算机科学与博弈论
多智能体系统
摘要
多智能体强化学习(MARL)处理含多个智能体的序贯决策问题,其中每个智能体优化其自身目标。在许多现实场景中,智能体可能不仅希望优化目标,还需确保行为安全。例如,在交通路由中,每辆车(智能体)旨在快速到达目的地(目标),同时避免碰撞(安全)。约束马尔可夫博弈(CMGs)是安全MARL问题的自然形式化框架,尽管通常难以求解。本工作中,我们引入并研究约束马尔可夫势博弈(CMPGs),这是CMGs的重要一类。我们首先证明CMPGs的纳什策略可通过约束优化求得。一种诱人的方法是通过基于拉格朗日的原始对偶法求解。然而我们表明,与单智能体设置不同,CMPGs不满足强对偶性,使得此类方法不适用且可能不安全。为求解CMPG问题,我们提出算法CMPG坐标上升法(CA-CMPG),该算法在表格化、有限时域CMPGs中可证明收敛到纳什策略。此外,我们给出了未知CMPGs中学习纳什策略的首个样本复杂度界,并在附加假设下保证安全探索。
引用
@article{arxiv.2306.07749,
title = {Provably Learning Nash Policies in Constrained Markov Potential Games},
author = {Pragnya Alatur and Giorgia Ramponi and Niao He and Andreas Krause},
journal= {arXiv preprint arXiv:2306.07749},
year = {2023}
}
备注
30 pages