中文

如何在不平稳的X臂老虎机中博弈而无悔

机器学习 2021-01-19 v3 机器学习 统计理论 统计理论

摘要

在X臂老虎机问题中,智能体与环境顺序交互,环境根据智能体提供的向量输入产生奖励。智能体的目标是在若干时间步内最大化这些奖励的总和。该问题及其变体已被大量研究,提出了次线性乃至有时最优的策略。本文引入该问题的一个新变体。我们考虑一个可能以未知次数突然改变其行为的环境。为此我们提出一种新策略,并证明其获得次线性累积悔值。此外,在动作与相应奖励之间高度光滑的关系下,该方法近乎最优。理论结果得到了实验研究的支持。

关键词

引用

@article{arxiv.1908.07636,
  title  = {How to gamble with non-stationary $\mathcal{X}$-armed bandits and have no regrets},
  author = {Valeriy Avanesov},
  journal= {arXiv preprint arXiv:1908.07636},
  year   = {2021}
}

备注

The algorithm is optimized, the theoretical result is more detailed now