广义策略消除:一种用于非参数上下文_bandit 的高效算法
机器学习
2020-03-09 v1 机器学习
摘要
我们提出广义策略消除(Generalized Policy Elimination, GPE)算法,这是一种受 \cite{dudik2011} 中策略消除算法启发的预言机高效上下文_bandit(CB)算法。我们证明了首个针对与无限 VC-维非参数类竞争的预言机高效 CB 算法的悔值最优性保证定理。具体而言,我们证明对于具有可积熵的策略类,GPE 是悔值最优的(相差对数因子)。对于具有更大熵的类,我们证明用于分析 GPE 的核心技术可用于设计 -贪婪算法,其悔值界与迄今最优算法相匹配。我们通过大型非参数策略类的例子说明了我们的算法与定理的适用性,这些类相关的优化预言机可被高效实现。
引用
@article{arxiv.2003.02873,
title = {Generalized Policy Elimination: an efficient algorithm for Nonparametric Contextual Bandits},
author = {Aurélien F. Bibaut and Antoine Chambaz and Mark J. van der Laan},
journal= {arXiv preprint arXiv:2003.02873},
year = {2020}
}