中文

利用鞅混合物的尾部界改进随机线性_bandit算法

机器学习 2024-09-06 v2 机器学习

摘要

我们提出了具有最坏情况后悔保证的改进算法,用于随机线性bandit问题。广泛使用的“面对不确定性保持乐观”原则将随机bandit问题归结为对未知奖励函数构造置信序列。所得bandit算法的性能取决于置信序列的大小,较小的置信集带来更好的经验性能和更强的后悔保证。在这项工作中,我们使用一种针对自适应鞅混合物的新尾部界来构造适用于随机bandit的置信序列。这些置信序列可通过凸规划实现高效动作选择。我们证明,基于我们的置信序列的线性bandit算法能够保证取得有竞争力的最坏情况后悔。我们表明,无论在经验上还是理论上,我们的置信序列都比同类方法更紧。最后,我们展示了我们更紧的置信序列在若干超参数调优任务中带来了改进的性能。

关键词

引用

@article{arxiv.2309.14298,
  title  = {Improved Algorithms for Stochastic Linear Bandits Using Tail Bounds for Martingale Mixtures},
  author = {Hamish Flynn and David Reeb and Melih Kandemir and Jan Peters},
  journal= {arXiv preprint arXiv:2309.14298},
  year   = {2024}
}

备注

Accepted at NeurIPS 2023. 35 pages, 6 figures