中文

基于_bandit_距离的随机_bandit_置信界调谐

机器学习 2021-10-07 v1 机器学习

摘要

我们提出了一种对随机多臂 bandit(MAB)问题标准上置信界(UCB)方法的新型改进,该方法基于给定 bandit 到其余 bandit 的距离来调谐其置信界。我们的 UCB 距离调谐(UCB-DT)公式通过防止 MAB 算法聚焦于非最优 bandit(这是标准 UCB 的已知缺陷)来提升以期望遗憾衡量的性能。标准 UCB 的“距离调谐”使用我们提出的一种称为 bandit 距离的可参数化距离度量完成,因此可优化该度量以根据问题需求控制从探索到利用的转移速率。我们通过实验证明了 UCB-DT 相对于许多使用 UCB 公式解决 MAB 问题的现有最先进方法具有更高性能。我们的贡献还包括开发了一个称为“探索交易点(Exploration Bargain Point)”的概念工具,它揭示了探索与利用之间的权衡。我们认为探索交易点提供了一种直观视角,有助于比较分析基于 UCB 的方法的性能。

关键词

引用

@article{arxiv.2110.02690,
  title  = {Tuning Confidence Bound for Stochastic Bandits with Bandit Distance},
  author = {Xinyu Zhang and Srinjoy Das and Ken Kreutz-Delgado},
  journal= {arXiv preprint arXiv:2110.02690},
  year   = {2021}
}