中文

广义线性_bandit 的高效算法:在线随机梯度下降与 Thompson 采样

机器学习 2021-06-08 v3 机器学习

摘要

我们考虑情境化 bandit 问题,其中玩家基于过往观测依次做出决策以最大化累积奖励。尽管已提出许多情境化 bandit 算法,但大多数依赖于在每次迭代中寻找极大似然估计,这在第 tt 次迭代时需要 O(t)O(t) 时间且内存效率低下。解决该问题的自然方法是对广义线性 bandit 问题应用在线随机梯度下降(SGD),使每步时间和内存复杂度相对于 tt 降为常数,但基于在线 SGD 更新、能平衡探索与利用的情境化 bandit 策略一直难以实现。本工作中,我们展示了在线 SGD 可应用于广义线性 bandit 问题。所提出的 SGD-TS 算法使用单步 SGD 更新来利用过往信息,并使用 Thompson Sampling 进行探索,取得了 O~(T)\tilde{O}(\sqrt{T}) 后悔界,总时间和复杂度随 TTdd 线性增长,其中 TT 为总轮数,dd 为特征数。实验结果表明,SGD-TS 在合成与真实数据集上均持续优于现有算法。

关键词

引用

@article{arxiv.2006.04012,
  title  = {An Efficient Algorithm For Generalized Linear Bandit: Online Stochastic Gradient Descent and Thompson Sampling},
  author = {Qin Ding and Cho-Jui Hsieh and James Sharpnack},
  journal= {arXiv preprint arXiv:2006.04012},
  year   = {2021}
}