以悲观粉碎乐观:渐近最优性之外的结构化_bandit
机器学习
2020-10-26 v2 机器学习
摘要
我们研究用于最小化后悔的随机结构化 bandit。流行的乐观算法无法实现渐近实例依赖后悔最优性(简称渐近最优性)这一事实近来引起了研究人员的注意。另一方面,已知在某些实例中可以实现有界后悔(即不随 无限增长)。遗憾的是,现有渐近最优算法依赖于强制采样,这在其后悔中引入了关于时间范围 的 项,未能适应实例的“简单性”。在本文中,我们关注有限假设情形,并探讨能否在可能时同时实现渐近最优性与有界后悔。我们通过引入一种称为以悲观粉碎乐观(CRush Optimism with Pessimism, CROP)的新算法给出了肯定回答,该算法通过抽取由悲观假设指示的信息臂来消除乐观假设。我们的有限时间分析表明,CROP 实现了常数因子的渐近最优性,并且得益于无强制探索的设计, 适应有界后悔,且 其后悔界不随 而是随我们引入的有效臂数 缩放。我们还讨论了一类问题,其中 CROP 在\textit{非渐近}情形下可指数级优于现有算法。该类问题还揭示了一个令人惊讶的事实:即便是按照渐近最优臂抽取方案行动的千里眼预言机,也可能遭受线性最坏情况后悔。
引用
@article{arxiv.2006.08754,
title = {Crush Optimism with Pessimism: Structured Bandits Beyond Asymptotic Optimality},
author = {Kwang-Sung Jun and Chicheng Zhang},
journal= {arXiv preprint arXiv:2006.08754},
year = {2020}
}
备注
accepted to NeurIPS'20; added the lower bound result