中文

具有 Bandit 反馈的在线提升

机器学习 2020-07-24 v1 机器学习

摘要

我们考虑回归任务的在线提升问题,此时学习者仅可获得有限信息。我们给出一种高效的遗憾最小化方法,它有两个推论:一个具有含噪多点 bandit 反馈的在线提升算法,以及一个具有随机梯度的无投影在线凸优化新算法,该算法在效率方面改进了现有最优保证。

关键词

引用

@article{arxiv.2007.11975,
  title  = {Online Boosting with Bandit Feedback},
  author = {Nataly Brukhim and Elad Hazan},
  journal= {arXiv preprint arXiv:2007.11975},
  year   = {2020}
}