利用人工壁垒进行自适应学习以在一般博弈中求得纳什均衡
计算机科学与博弈论
2022-04-05 v2 人工智能
摘要
学习自动机(LA)中的人工壁垒是一个强大却未被充分探索的概念,尽管它早在 1980 年代就被提出。引入人工非吸收壁垒使 LA 方案能避免陷入吸收壁垒,后者常被称为概率锁定,导致收敛后 exclusively 选择单一动作。在 LA 及广义强化学习领域,带有理论著作与应用方案的人工壁垒研究十分匮乏。本文设计了一种带人工壁垒的 LA 来求解一般形式的随机双矩阵博弈。经典 LA 系统具有吸收壁垒性质,是博弈论中的有力工具,并已被证明在有限信息下收敛到博弈的纳什均衡。然而,用于求解博弈论问题的 LA 工作流仅能处理博弈鞍点存在于纯策略的情形,并在纯策略无鞍点时无法达到混合纳什均衡。本文借助人工壁垒这一强大概念,提出了一种即便在纯策略下可能无鞍点时仍收敛到最优混合纳什均衡的 LA。我们所部署的方案属于线性奖励-不作用()类型,其原本是一种吸收性 LA 方案;但我们以优雅而自然的方式引入人工壁垒使其变为非吸收性,即著名的传统 方案可视为我们所提算法在某一特定壁垒选择下的实例。此外,我们给出了带吸收壁垒的 LA 的 学习版本,其能处理 -学习环境,其中反馈是连续的而非如 中的二值形式。
引用
@article{arxiv.2203.15780,
title = {Adaptive Learning with Artificial Barriers Yielding Nash Equilibria in General Games},
author = {Ismail Hassan and B. John Oommen and Anis Yazidi},
journal= {arXiv preprint arXiv:2203.15780},
year = {2022}
}