中文

在有限时间内演化的情境化多臂老虎机

机器学习 2019-11-15 v1 机器学习

摘要

情境化多臂老虎机(contextual bandits)与标准多臂老虎机具有相同的探索-利用权衡。在加入随时间衰减的正外部性后,该问题变得困难得多,因为初期的错误决策难以恢复。我们在此设定下探究现有策略,并强调它们对固有奖励矩阵的偏向。我们提出一种基于拒绝的策略,无论奖励概率矩阵的结构如何,都能实现低后悔值。

关键词

引用

@article{arxiv.1911.05956,
  title  = {Contextual Bandits Evolving Over Finite Time},
  author = {Harsh Deshpande and Vishal Jain and Sharayu Moharir},
  journal= {arXiv preprint arXiv:1911.05956},
  year   = {2019}
}