无限动作空间下汤普森采样的信息论分析
机器学习
2025-02-05 v1 机器学习
摘要
本文基于 Russo 和 Van Roy (2015) 引入的信息论框架,研究赌博机问题中汤普森采样算法的贝叶斯遗憾。具体而言,它扩展了 Dong 和 Van Roy (2018) 的率失真分析,该分析为线性赌博机提供了接近最优的界。这些结果的一个局限性是假设动作空间是有限的。我们通过将分析扩展到具有无限和连续动作空间的设置来解决这个问题。此外,我们将结果特化到期望奖励关于动作空间满足利普希茨连续的赌博机问题,推导出一个明确考虑了动作空间复杂度的遗憾界。
引用
@article{arxiv.2502.02140,
title = {An Information-Theoretic Analysis of Thompson Sampling with Infinite Action Spaces},
author = {Amaury Gouverneur and Borja Rodriguez Gálvez and Tobias Oechtering and Mikael Skoglund},
journal= {arXiv preprint arXiv:2502.02140},
year = {2025}
}
备注
5 pages, accepted to ICASSP