中文

均衡赌博机:学习未知动力学的最优均衡

机器学习 2023-02-28 v1 多智能体系统

摘要

考虑一个决策者在 TT 个回合中可从 KK 个动作中选取一个以控制未知系统。这些动作被解释为不同配置或策略。若固定同一动作,系统将渐近收敛至作为该动作函数的唯一均衡。系统动力学对决策者未知,其仅能在每回合结束时观测到带噪奖励。决策者希望最大化 TT 个回合的累积奖励。学习何种均衡更优可带来更高奖励,但等待系统收敛至均衡会耗费宝贵时间。现有赌博机算法(随机或对抗性)对该问题均取得线性(平凡)后悔界。我们提出一种称为上均衡集中界(UECB)的新算法,能在某动作不值得等待至均衡达成时迅速切换。这通过采用收敛界判定系统距均衡多远来实现。我们证明,对该均衡赌博机问题,UECB 取得 O(log(T)+τclog(τc)+τcloglog(T))\mathcal{O}(\log(T)+\tau_c\log(\tau_c)+\tau_c\log\log(T)) 的后悔界,其中 τc\tau_c 为最坏情况近似收敛至均衡的时间。我们随后表明,疫情控制与博弈控制均为均衡赌博机的特例,其中 τclogτc\tau_c\log \tau_c 通常主导后悔值。我们随后对这两类应用数值测试了 UECB。

关键词

引用

@article{arxiv.2302.13653,
  title  = {Equilibrium Bandits: Learning Optimal Equilibria of Unknown Dynamics},
  author = {Siddharth Chandak and Ilai Bistritz and Nicholas Bambos},
  journal= {arXiv preprint arXiv:2302.13653},
  year   = {2023}
}

备注

Accepted at the 22nd International Conference on Autonomous Agents and Multiagent Systems (2023)