离线 bandits 的精炼 PAC-Bayes 边界
机器学习
2025-02-18 v1 机器学习
摘要
本文提出了关于离线 bandits 中经验奖励估计的精炼概率边界。我们在 Seldin et al. (2010) 的 PAC-Bayes 边界基础上进行改进,利用 Rodr\'iguez et al. (2024) 引入的新型参数优化方法。该技术基于对可能事件空间的离散化,以优化 '以概率' 参数。我们提供两个无参数 PAC-Bayes 边界,一个基于 Hoeffding-Azuma 不等式,另一个基于 Bernstein 不等式。我们证明我们的边界在几乎最优,因为它们恢复了在数据实现后设置 '以概率' 参数所获得的相同收敛率。
引用
@article{arxiv.2502.11953,
title = {Refined PAC-Bayes Bounds for Offline Bandits},
author = {Amaury Gouverneur and Tobias J. Oechtering and Mikael Skoglund},
journal= {arXiv preprint arXiv:2502.11953},
year = {2025}
}
备注
6 pages