中文

在非平稳随机环境中追踪最佳专家

机器学习 2019-06-24 v2

摘要

我们研究了多臂赌博机和专家问题在非平稳随机环境中的动态后悔。我们引入一个新参数 Λ\Lambda,它度量了在 TT 轮过程中损失分布的总统计方差,并研究该量如何影响后悔。我们考察了 Λ\LambdaΓ\Gamma(统计分布改变的次数)之间,以及 Λ\LambdaVV(度量分布随时间偏离程度)之间的相互作用。我们发现的一个惊人结果是,即使 Γ\GammaVVΛ\Lambda 均限制为常数,赌博机设定下的后悔下界仍随 TT 增长。另一亮点是,在完全信息设定下,当 Γ\GammaΛ\Lambda 为常数时,可实现与 TT 无关常数级后悔,而当 VVΛ\Lambda 为常数时,后悔仍有 T1/3T^{1/3} 的依赖。我们不仅提出了具有上界保证的算法,还证明了与之匹配的下界。

关键词

引用

@article{arxiv.1712.00578,
  title  = {Tracking the Best Expert in Non-stationary Stochastic Environments},
  author = {Chen-Yu Wei and Yi-Te Hong and Chi-Jen Lu},
  journal= {arXiv preprint arXiv:1712.00578},
  year   = {2019}
}