中文

未知博弈中无遗憾学习的乐观Thompson采样

机器学习 2024-02-27 v2 人工智能 计算机科学与博弈论 机器学习

摘要

本工作解决了未知博弈中多玩家场景的复杂性,主要挑战在于通过赌博机反馈和战略决策来应对环境的不确定性。我们引入了基于Thompson采样(TS)的算法,利用对手动作和奖励结构的信息,显著减少了实验预算——相比传统方法实现了十倍以上的改进。值得注意的是,我们的算法表明,在特定奖励结构下,遗憾界与总动作空间成对数关系,显著缓解了多玩家诅咒。此外,我们揭示了乐观-然后-无遗憾(OTN)框架,这是一种开创性的方法论,将我们的进展与已有算法无缝结合,展示了其在现实世界场景(如交通路由和雷达感知)中的实用性。

关键词

引用

@article{arxiv.2402.09456,
  title  = {Optimistic Thompson Sampling for No-Regret Learning in Unknown Games},
  author = {Yingru Li and Liangqi Liu and Wenqiang Pu and Hao Liang and Zhi-Quan Luo},
  journal= {arXiv preprint arXiv:2402.09456},
  year   = {2024}
}