具有 Bandit 反馈的在线提升
机器学习
2020-07-24 v1 机器学习
摘要
我们考虑回归任务的在线提升问题,此时学习者仅可获得有限信息。我们给出一种高效的遗憾最小化方法,它有两个推论:一个具有含噪多点 bandit 反馈的在线提升算法,以及一个具有随机梯度的无投影在线凸优化新算法,该算法在效率方面改进了现有最优保证。
引用
@article{arxiv.2007.11975,
title = {Online Boosting with Bandit Feedback},
author = {Nataly Brukhim and Elad Hazan},
journal= {arXiv preprint arXiv:2007.11975},
year = {2020}
}