中文

离线 bandits 的精炼 PAC-Bayes 边界

机器学习 2025-02-18 v1 机器学习

摘要

本文提出了关于离线 bandits 中经验奖励估计的精炼概率边界。我们在 Seldin et al. (2010) 的 PAC-Bayes 边界基础上进行改进,利用 Rodr\'iguez et al. (2024) 引入的新型参数优化方法。该技术基于对可能事件空间的离散化,以优化 '以概率' 参数。我们提供两个无参数 PAC-Bayes 边界,一个基于 Hoeffding-Azuma 不等式,另一个基于 Bernstein 不等式。我们证明我们的边界在几乎最优,因为它们恢复了在数据实现后设置 '以概率' 参数所获得的相同收敛率。

关键词

引用

@article{arxiv.2502.11953,
  title  = {Refined PAC-Bayes Bounds for Offline Bandits},
  author = {Amaury Gouverneur and Tobias J. Oechtering and Mikael Skoglund},
  journal= {arXiv preprint arXiv:2502.11953},
  year   = {2025}
}

备注

6 pages