中文

一般线性上下文赌博机中最优策略价值的估计

机器学习 2023-02-21 v1 机器学习

摘要

在许多赌博机问题中,一个策略所能达到的最大奖励通常是事先未知的。我们考虑在次线性数据规模下,甚至在最优策略尚不可学习之前,估计最优策略价值的问题。我们将此称为VV^*估计。最近的研究表明,快速的VV^*估计是可能的,但仅限于具有高斯协变量的不相交线性赌博机。对于更现实的上下文分布,这是否可行,对于模型选择等任务来说,一直是一个悬而未决的重要问题。在本文中,我们首先提供了下界,表明这个一般性问题是困难的。然而,在更强的假设下,我们给出了一种算法和分析,证明O~(d)\widetilde{\mathcal{O}}(\sqrt{d})VV^*次线性估计在信息论上确实是可能的,其中dd是维度。然后,我们提出了一种更实用、计算效率更高的算法,该算法估计VV^*的一个问题相关的上界,该上界适用于一般分布,并且在上下文分布为高斯时是紧的。我们证明了我们的算法仅需O~(d)\widetilde{\mathcal{O}}(\sqrt{d})个样本即可估计该上界。我们利用这个上界和估计器,为赌博机模型选择和处置效应检验中的若干应用获得了新颖且改进的保证。

关键词

引用

@article{arxiv.2302.09451,
  title  = {Estimating Optimal Policy Value in General Linear Contextual Bandits},
  author = {Jonathan N. Lee and Weihao Kong and Aldo Pacchiano and Vidya Muthukumar and Emma Brunskill},
  journal= {arXiv preprint arXiv:2302.09451},
  year   = {2023}
}