老虎机算法:为统计鲁棒性放弃对数遗憾
机器学习
2020-06-23 v1 机器学习
摘要
我们研究了随机多臂老虎机设置中的遗憾最小化问题,并建立了算法所遭受的遗憾与其统计鲁棒性之间的基本权衡。考虑底层臂分布的广泛类别,我们证明具有对数遗憾的老虎机学习算法总是不一致的,而一致的学习算法总是遭受超对数遗憾。这一结果凸显了文献中所有“对数遗憾”老虎机算法不可避免的统计脆弱性——例如,如果为σ-次高斯分布设计的UCB算法在方差参数不匹配的次高斯设置中使用,学习性能可能不一致。接下来,我们展示了一个积极结果:如果我们允许遗憾略差于对数,则可以实现统计鲁棒且一致的学习性能。具体而言,我们提出了三类分布无关算法,它们实现了渐近遗憾任意接近对数。
引用
@article{arxiv.2006.12038,
title = {Bandit algorithms: Letting go of logarithmic regret for statistical robustness},
author = {Kumar Ashutosh and Jayakrishnan Nair and Anmol Kagrecha and Krishna Jagannathan},
journal= {arXiv preprint arXiv:2006.12038},
year = {2020}
}