中文

$K$ 臂_bandit 中对值域的适应

统计理论 2022-06-16 v3 机器学习 统计理论

摘要

我们考虑具有 KK 个臂的随机 bandit 问题,每个臂关联一个支撑于区间 [m,M][m,M] 上的有界分布。我们不假设区间 [m,M][m,M] 已知,并表明学习该区间存在代价。事实上,出现了一种依赖分布与独立于分布的 regret 界之间的新权衡,其阻碍同时实现典型的 lnT\ln TT\sqrt{T} 界。例如,仅当依赖分布的 regret 界至少为 T\sqrt{T} 阶时,才可能实现 T\sqrt{T} 的独立分布 regret 界。我们给出了一种策略,实现了新权衡所指示的 regret 速率。

关键词

引用

@article{arxiv.2006.03378,
  title  = {Adaptation to the Range in $K$-Armed Bandits},
  author = {Hédi Hadiji and Gilles Stoltz},
  journal= {arXiv preprint arXiv:2006.03378},
  year   = {2022}
}