中文

Bandit问题的PAC-Bayes界:综述与实验比较

机器学习 2023-09-26 v2 机器学习

摘要

PAC-Bayes近来重新成为一种有效的理论,可借此推导具有严格性能保证的原则性学习算法。然而,PAC-Bayes在bandit问题上的应用相对稀少,这是一大遗憾。医疗、金融和自然科学中的许多决策问题都可建模为bandit问题。在这类应用中,具有强性能保证的原则性算法将备受青睐。本综述概述了bandit问题的PAC-Bayes界,并对这些界进行了实验比较。一方面,我们发现PAC-Bayes界是设计具有性能保证的离线bandit算法的有用工具。在我们的实验中,一个PAC-Bayesian离线上下文bandit算法能够学习到具有竞争性期望奖励和非平凡性能保证的随机神经网络策略。另一方面,我们所测试的PAC-Bayesian在线bandit算法具有宽松的累积后悔界。最后我们讨论了PAC-Bayesian bandit算法未来工作的若干方向。

关键词

引用

@article{arxiv.2211.16110,
  title  = {PAC-Bayes Bounds for Bandit Problems: A Survey and Experimental Comparison},
  author = {Hamish Flynn and David Reeb and Melih Kandemir and Jan Peters},
  journal= {arXiv preprint arXiv:2211.16110},
  year   = {2023}
}

备注

32 pages, 8 figures