中文

非平稳随机_bandit动态后悔的新视角

机器学习 2022-03-09 v3 机器学习

摘要

我们研究非平稳随机多臂bandit问题,其中每臂的奖励统计在学习过程中可能发生若干次变化。学习算法的性能通过其动态后悔来评估,动态后悔定义为在每个时间步都选择最优臂的智能体的期望累积奖励与学习算法的累积奖励之差。衡量此类环境难度的一种方式是考虑最优臂的标识可改变的次数。我们提出一种方法,在KK臂bandit问题中实现近最优的O~(KN(S+1))\widetilde O(\sqrt{K N(S+1)})动态后悔,其中NN为问题的时间范围,SS为最优臂标识改变的次数,且无需SS的先验知识。该问题的先前工作获得的后悔界随奖励函数的变化次数(或变化量)缩放,可能大得多,或假设已知SS才能达到类似界。

关键词

引用

@article{arxiv.2201.06532,
  title  = {A New Look at Dynamic Regret for Non-Stationary Stochastic Bandits},
  author = {Yasin Abbasi-Yadkori and Andras Gyorgy and Nevena Lazic},
  journal= {arXiv preprint arXiv:2201.06532},
  year   = {2022}
}