在非平稳随机环境中追踪最佳专家
机器学习
2019-06-24 v2
摘要
我们研究了多臂赌博机和专家问题在非平稳随机环境中的动态后悔。我们引入一个新参数 ,它度量了在 轮过程中损失分布的总统计方差,并研究该量如何影响后悔。我们考察了 与 (统计分布改变的次数)之间,以及 与 (度量分布随时间偏离程度)之间的相互作用。我们发现的一个惊人结果是,即使 、 和 均限制为常数,赌博机设定下的后悔下界仍随 增长。另一亮点是,在完全信息设定下,当 和 为常数时,可实现与 无关常数级后悔,而当 和 为常数时,后悔仍有 的依赖。我们不仅提出了具有上界保证的算法,还证明了与之匹配的下界。
引用
@article{arxiv.1712.00578,
title = {Tracking the Best Expert in Non-stationary Stochastic Environments},
author = {Chen-Yu Wei and Yi-Te Hong and Chi-Jen Lu},
journal= {arXiv preprint arXiv:1712.00578},
year = {2019}
}