中文

不平静线性赌博机

机器学习 2024-05-20 v1 信息论 机器学习 math.IT

摘要

我们考虑线性赌博机问题的一个更一般的公式,以允许随时间变化的依赖性。具体来说,假设存在一个未知的、取值为Rd\mathbb{R}^d的平稳φ\varphi-混合参数序列(θt, tN)(\theta_t,~t \in \mathbb{N}),它产生了收益。这个问题的实例可以被视为经典独立同分布噪声线性赌博机和有限臂不平静赌博机两者的推广。鉴于不平静赌博机最优策略的众所周知的计算困难性,我们提出了一种近似方法,并证明其误差由连续θt\theta_t之间的φ\varphi-依赖性控制。对于θt\theta_t具有指数混合速率的情况,我们提出了一种乐观算法,称为LinMix-UCB。我们证明,相对于一个总是玩Eθt\mathbb{E}\theta_t倍数的预言机,所提出的算法产生O(dnpolylog(n))\mathcal{O}\left(\sqrt{d n\mathrm{polylog}(n) }\right)的次线性遗憾。该设置中的主要挑战是确保探索-利用策略对长程依赖具有鲁棒性。所提出的方法依赖于Berbee耦合引理来仔细选择近独立样本,并围绕Eθt\mathbb{E}\theta_t的经验估计构建置信椭球。

关键词

引用

@article{arxiv.2405.10817,
  title  = {Restless Linear Bandits},
  author = {Azadeh Khaleghi},
  journal= {arXiv preprint arXiv:2405.10817},
  year   = {2024}
}