分段常数 Bandit 中的固定预算变点识别
机器学习
2025-01-23 v1 机器学习
摘要
我们研究了分段常数 bandit 问题,其中期望奖励是跨动作空间 具有一个变点(不连续性)的分段常数函数,学习者的目标是定位该变点。在固定探索预算的假设下,我们首次对旨在 bandit 反馈下定位平均奖励函数中突变的策略进行了非渐近分析。我们在大预算和小预算机制下研究了该问题,并为两种设定建立了错误概率的下界,同时提供了近乎匹配的上界算法。有趣的是,我们的结果显示了这两种机制在复杂性上的分离。随后,我们提出了一种机制自适应算法,该算法对于小预算和大预算同时近似最优。我们用模拟环境中的实验结果补充了我们的理论分析,以支持我们的发现。
引用
@article{arxiv.2501.12957,
title = {Fixed-Budget Change Point Identification in Piecewise Constant Bandits},
author = {Joseph Lazzaro and Ciara Pike-Burke},
journal= {arXiv preprint arXiv:2501.12957},
year = {2025}
}
备注
44 pages, 7 figures