$K$ 臂_bandit 中对值域的适应
统计理论
2022-06-16 v3 机器学习
统计理论
摘要
我们考虑具有 个臂的随机 bandit 问题,每个臂关联一个支撑于区间 上的有界分布。我们不假设区间 已知,并表明学习该区间存在代价。事实上,出现了一种依赖分布与独立于分布的 regret 界之间的新权衡,其阻碍同时实现典型的 与 界。例如,仅当依赖分布的 regret 界至少为 阶时,才可能实现 的独立分布 regret 界。我们给出了一种策略,实现了新权衡所指示的 regret 速率。
引用
@article{arxiv.2006.03378,
title = {Adaptation to the Range in $K$-Armed Bandits},
author = {Hédi Hadiji and Gilles Stoltz},
journal= {arXiv preprint arXiv:2006.03378},
year = {2022}
}