中文

有限参数化多臂老虎机的有限后悔界

机器学习 2020-11-10 v5 机器学习

摘要

我们考虑有限参数化多臂老虎机问题,其中底层随机环境的模型可基于一个公共未知参数来刻画。真实参数对学习智能体未知。然而,可能的参数集合(有限)是先验已知的。我们提出了一种简单且易于实现的算法,称为有限参数化上置信界(FP-UCB)算法,其利用关于底层参数集合的信息以实现更快学习。特别地,我们证明在某些底层参数集合的结构条件下,FP-UCB算法实现了有界后悔。我们还证明,若底层参数集合不满足必要的结构条件,FP-UCB算法实现对数后悔,但其前置常数小于标准UCB算法。我们还通过大量数值模拟验证了FP-UCB算法的优越性能。

关键词

引用

@article{arxiv.2003.01328,
  title  = {Bounded Regret for Finitely Parameterized Multi-Armed Bandits},
  author = {Kishan Panaganti and Dileep Kalathil},
  journal= {arXiv preprint arXiv:2003.01328},
  year   = {2020}
}

备注

15 pages, 7 figures, Reinforcement Learning, Multi-armed Bandits, Sequential Decision Making