带保证的 PAC-Bayesian 离线上下文_bandits
机器学习
2023-05-30 v2 机器学习
摘要
本文提出一种用于上下文_bandits 中离策略学习的新原则性方法。与先前工作不同,我们的方法不从难以处理或宽松的界推导学习原理。我们通过 PAC-Bayesian 视角分析问题,将策略解释为决策规则的混合。这使我们能够提出新的泛化界,并给出可处理的算法来优化它们。我们证明所推导的界比其竞争者更紧,并且可以直接优化以在离线状态下可靠地改进日志策略。我们的方法学习带保证的策略,使用所有可用数据,且不需要在留出集上调整额外超参数。我们通过大量实验展示了我们的方法在实际场景中提供性能保证的有效性。
引用
@article{arxiv.2210.13132,
title = {PAC-Bayesian Offline Contextual Bandits With Guarantees},
author = {Otmane Sakhi and Pierre Alquier and Nicolas Chopin},
journal= {arXiv preprint arXiv:2210.13132},
year = {2023}
}
备注
Accepted to ICML 2023