均衡赌博机:学习未知动力学的最优均衡
机器学习
2023-02-28 v1 多智能体系统
摘要
考虑一个决策者在 个回合中可从 个动作中选取一个以控制未知系统。这些动作被解释为不同配置或策略。若固定同一动作,系统将渐近收敛至作为该动作函数的唯一均衡。系统动力学对决策者未知,其仅能在每回合结束时观测到带噪奖励。决策者希望最大化 个回合的累积奖励。学习何种均衡更优可带来更高奖励,但等待系统收敛至均衡会耗费宝贵时间。现有赌博机算法(随机或对抗性)对该问题均取得线性(平凡)后悔界。我们提出一种称为上均衡集中界(UECB)的新算法,能在某动作不值得等待至均衡达成时迅速切换。这通过采用收敛界判定系统距均衡多远来实现。我们证明,对该均衡赌博机问题,UECB 取得 的后悔界,其中 为最坏情况近似收敛至均衡的时间。我们随后表明,疫情控制与博弈控制均为均衡赌博机的特例,其中 通常主导后悔值。我们随后对这两类应用数值测试了 UECB。
引用
@article{arxiv.2302.13653,
title = {Equilibrium Bandits: Learning Optimal Equilibria of Unknown Dynamics},
author = {Siddharth Chandak and Ilai Bistritz and Nicholas Bambos},
journal= {arXiv preprint arXiv:2302.13653},
year = {2023}
}
备注
Accepted at the 22nd International Conference on Autonomous Agents and Multiagent Systems (2023)