中文

可微线性_bandit 算法

机器学习 2020-06-05 v1 人工智能 机器学习

摘要

上置信界(UCB)可以说是线性多臂 bandit 问题最常用的方法。尽管在概念和计算上简单,该方法高度依赖置信界,若这些界设置不当则无法达成最优探索-利用权衡。文献中,置信界通常基于奖励分布假设(如次高斯性)由集中不等式导出。然而这些假设的有效性在实践中未知。本工作中,我们旨在以数据驱动方式学习置信界,使其适应实际问题结构。具体而言,注意到现有 UCB 型算法关于置信界不可微,我们首先提出一种新颖的可微线性 bandit 算法。随后,我们引入梯度估计器,允许通过梯度上升学习置信界。理论上,我们证明所提算法达到 TT 轮后悔的 O~(β^dT)\tilde{\mathcal{O}}(\hat{\beta}\sqrt{dT}) 上界,其中 dd 为臂特征的维度,β^\hat{\beta} 为学习到的置信界大小。实证结果显示 β^\hat{\beta} 显著小于其理论上界,且所提算法在模拟与真实数据集上均优于基线方法。

关键词

引用

@article{arxiv.2006.03000,
  title  = {Differentiable Linear Bandit Algorithm},
  author = {Kaige Yang and Laura Toni},
  journal= {arXiv preprint arXiv:2006.03000},
  year   = {2020}
}

备注

16 pages