有限参数化多臂老虎机的有限后悔界
机器学习
2020-11-10 v5 机器学习
摘要
我们考虑有限参数化多臂老虎机问题,其中底层随机环境的模型可基于一个公共未知参数来刻画。真实参数对学习智能体未知。然而,可能的参数集合(有限)是先验已知的。我们提出了一种简单且易于实现的算法,称为有限参数化上置信界(FP-UCB)算法,其利用关于底层参数集合的信息以实现更快学习。特别地,我们证明在某些底层参数集合的结构条件下,FP-UCB算法实现了有界后悔。我们还证明,若底层参数集合不满足必要的结构条件,FP-UCB算法实现对数后悔,但其前置常数小于标准UCB算法。我们还通过大量数值模拟验证了FP-UCB算法的优越性能。
引用
@article{arxiv.2003.01328,
title = {Bounded Regret for Finitely Parameterized Multi-Armed Bandits},
author = {Kishan Panaganti and Dileep Kalathil},
journal= {arXiv preprint arXiv:2003.01328},
year = {2020}
}
备注
15 pages, 7 figures, Reinforcement Learning, Multi-armed Bandits, Sequential Decision Making