如何在不平稳的X臂老虎机中博弈而无悔
机器学习
2021-01-19 v3 机器学习
统计理论
统计理论
摘要
在X臂老虎机问题中,智能体与环境顺序交互,环境根据智能体提供的向量输入产生奖励。智能体的目标是在若干时间步内最大化这些奖励的总和。该问题及其变体已被大量研究,提出了次线性乃至有时最优的策略。本文引入该问题的一个新变体。我们考虑一个可能以未知次数突然改变其行为的环境。为此我们提出一种新策略,并证明其获得次线性累积悔值。此外,在动作与相应奖励之间高度光滑的关系下,该方法近乎最优。理论结果得到了实验研究的支持。
引用
@article{arxiv.1908.07636,
title = {How to gamble with non-stationary $\mathcal{X}$-armed bandits and have no regrets},
author = {Valeriy Avanesov},
journal= {arXiv preprint arXiv:1908.07636},
year = {2021}
}
备注
The algorithm is optimized, the theoretical result is more detailed now