中文

分段常数 Bandit 中的固定预算变点识别

机器学习 2025-01-23 v1 机器学习

摘要

我们研究了分段常数 bandit 问题,其中期望奖励是跨动作空间 [0,1][0,1] 具有一个变点(不连续性)的分段常数函数,学习者的目标是定位该变点。在固定探索预算的假设下,我们首次对旨在 bandit 反馈下定位平均奖励函数中突变的策略进行了非渐近分析。我们在大预算和小预算机制下研究了该问题,并为两种设定建立了错误概率的下界,同时提供了近乎匹配的上界算法。有趣的是,我们的结果显示了这两种机制在复杂性上的分离。随后,我们提出了一种机制自适应算法,该算法对于小预算和大预算同时近似最优。我们用模拟环境中的实验结果补充了我们的理论分析,以支持我们的发现。

关键词

引用

@article{arxiv.2501.12957,
  title  = {Fixed-Budget Change Point Identification in Piecewise Constant Bandits},
  author = {Joseph Lazzaro and Ciara Pike-Burke},
  journal= {arXiv preprint arXiv:2501.12957},
  year   = {2025}
}

备注

44 pages, 7 figures