带切换约束的赌博机中的相变
机器学习
2021-03-22 v4 数据结构与算法
最优化与控制
机器学习
摘要
我们考虑经典随机多臂赌博机问题,其约束为动作间切换产生的总代价不超过给定切换预算。对于该问题,我们证明了最优(即极小极大)遗憾的上界与下界相匹配,并给出高效的速率最优算法。令人惊讶的是,该问题的最优遗憾关于时间范围和臂数呈现出非传统的增长率。由此,我们发现了关于最优遗憾率如何随切换预算变化的惊人“相变”:当臂数固定时,存在等长的阶段,每个阶段内最优遗憾率(几乎)不变且在阶段间突变;当臂数随时间范围增长时,此类突变变得微妙甚至可能消失,但涉及某些新度量的广义相变概念仍然存在。这些结果使我们能够完整刻画随机多臂赌博机问题中遗憾率与所产生切换代价之间的权衡,为该基本问题提供新见解。在一般切换代价结构下,结果揭示了赌博机问题与图遍历问题(如最短哈密顿路径问题)之间的有趣联系。
引用
@article{arxiv.1905.10825,
title = {Phase Transitions in Bandits with Switching Constraints},
author = {David Simchi-Levi and Yunzong Xu},
journal= {arXiv preprint arXiv:1905.10825},
year = {2021}
}
备注
An enhanced version. Many new results are obtained. The presentation is improved