中文

约束马尔可夫势博弈中纳什策略的可证明学习

机器学习 2023-06-14 v1 计算机科学与博弈论 多智能体系统

摘要

多智能体强化学习(MARL)处理含多个智能体的序贯决策问题,其中每个智能体优化其自身目标。在许多现实场景中,智能体可能不仅希望优化目标,还需确保行为安全。例如,在交通路由中,每辆车(智能体)旨在快速到达目的地(目标),同时避免碰撞(安全)。约束马尔可夫博弈(CMGs)是安全MARL问题的自然形式化框架,尽管通常难以求解。本工作中,我们引入并研究约束马尔可夫势博弈(CMPGs),这是CMGs的重要一类。我们首先证明CMPGs的纳什策略可通过约束优化求得。一种诱人的方法是通过基于拉格朗日的原始对偶法求解。然而我们表明,与单智能体设置不同,CMPGs不满足强对偶性,使得此类方法不适用且可能不安全。为求解CMPG问题,我们提出算法CMPG坐标上升法(CA-CMPG),该算法在表格化、有限时域CMPGs中可证明收敛到纳什策略。此外,我们给出了未知CMPGs中学习纳什策略的首个样本复杂度界,并在附加假设下保证安全探索。

关键词

引用

@article{arxiv.2306.07749,
  title  = {Provably Learning Nash Policies in Constrained Markov Potential Games},
  author = {Pragnya Alatur and Giorgia Ramponi and Niao He and Andreas Krause},
  journal= {arXiv preprint arXiv:2306.07749},
  year   = {2023}
}

备注

30 pages