面向扩展式相关均衡的无悔学习动力学
计算机科学与博弈论
2022-09-05 v5 人工智能
机器学习
多智能体系统
摘要
在正规形式博弈中存在简单的、解耦的无悔动力学收敛到相关均衡,是多智能体系统理论中的一个著名结果。具体而言,二十多年来已知,当所有博弈方在重复正规形式博弈中寻求最小化其内部后悔时,经验博弈频率收敛到正规形式相关均衡。扩展式(即树形)博弈通过建模序贯与同时行动以及私有信息,推广了正规形式博弈。由于博弈的序贯性质和部分信息的存在,扩展式相关具有与正规形式对应物显著不同的性质,其中许多仍是开放的研究方向。扩展式相关均衡(EFCE)已被提出作为正规形式相关均衡的自然扩展式对应物。然而,目前尚不清楚 EFCE 是否作为解耦智能体动力学的结果而出现。在本文中,我们给出首个解耦的无悔动力学,在具有完美回忆的 博弈方一般和扩展式博弈中收敛到 EFCE 集合。首先,我们引入扩展式博弈中的触发后悔概念,推广了正规形式博弈中的内部后悔。当每个博弈方具有低触发后悔时,经验博弈频率接近于一个 EFCE。然后,我们给出一个高效的无触发后悔算法。我们的算法将触发后悔分解为该博弈方在每个决策点的局部子问题,并从每个决策点的局部解构造博弈方的全局策略。
引用
@article{arxiv.2004.00603,
title = {No-Regret Learning Dynamics for Extensive-Form Correlated Equilibrium},
author = {Andrea Celli and Alberto Marchesi and Gabriele Farina and Nicola Gatti},
journal= {arXiv preprint arXiv:2004.00603},
year = {2022}
}