可微线性_bandit 算法
机器学习
2020-06-05 v1 人工智能
机器学习
摘要
上置信界(UCB)可以说是线性多臂 bandit 问题最常用的方法。尽管在概念和计算上简单,该方法高度依赖置信界,若这些界设置不当则无法达成最优探索-利用权衡。文献中,置信界通常基于奖励分布假设(如次高斯性)由集中不等式导出。然而这些假设的有效性在实践中未知。本工作中,我们旨在以数据驱动方式学习置信界,使其适应实际问题结构。具体而言,注意到现有 UCB 型算法关于置信界不可微,我们首先提出一种新颖的可微线性 bandit 算法。随后,我们引入梯度估计器,允许通过梯度上升学习置信界。理论上,我们证明所提算法达到 轮后悔的 上界,其中 为臂特征的维度, 为学习到的置信界大小。实证结果显示 显著小于其理论上界,且所提算法在模拟与真实数据集上均优于基线方法。
引用
@article{arxiv.2006.03000,
title = {Differentiable Linear Bandit Algorithm},
author = {Kaige Yang and Laura Toni},
journal= {arXiv preprint arXiv:2006.03000},
year = {2020}
}
备注
16 pages