Thompson Sampling 与 UCB 的反馈图后悔界
机器学习
2020-02-17 v3 数据结构与算法
机器学习
摘要
我们研究了 Mannor 和 Shamir 提出的基于图的反馈结构下的随机多臂老虎机问题。我们分析了两种最著名的随机老虎机算法——Thompson Sampling 与上置信界(UCB)——在基于图的反馈设定下的性能。我们表明,这些算法取得了结合了图结构与臂分布均值之间差距的后悔保证。令人惊讶的是,尽管这些算法并未显式利用图结构来选择臂;它们观察到额外反馈但并不基于其进行探索,这一结论依然成立。为得到该结果,我们引入了一种“分层技术”,凸显了这两种算法的共性。
引用
@article{arxiv.1905.09898,
title = {Feedback graph regret bounds for Thompson Sampling and UCB},
author = {Thodoris Lykouris and Eva Tardos and Drishti Wali},
journal= {arXiv preprint arXiv:1905.09898},
year = {2020}
}
备注
Appeared in ALT 2020