使用 $\ell_p$ 置信集的离线线性上下文老虎机悲观方法
机器学习
2022-10-06 v2 机器学习
摘要
我们提出了一族 用于离线学习线性上下文老虎机(contextual bandits)的悲观学习规则,其依赖于关于不同 范数的置信集,其中 对应于 Bellman 一致悲观(BCP),而 是将下置信界(LCB)推广到线性设定的一种新方法。我们证明了新的 学习规则在某种意义上是自适应最优的,因为它针对所有 约束问题达到了极小极大性能(相差对数因子),因此它在族中严格支配所有其他预测器,包括 。
引用
@article{arxiv.2205.10671,
title = {Pessimism for Offline Linear Contextual Bandits using $\ell_p$ Confidence Sets},
author = {Gene Li and Cong Ma and Nathan Srebro},
journal= {arXiv preprint arXiv:2205.10671},
year = {2022}
}
备注
Accepted to NeurIPS 2022