分段独立同分布 Bandit 的安全感知变点检测
机器学习
2022-05-30 v1 人工智能
摘要
在本文中,我们考虑在安全约束下的分段独立同分布(i.i.d.)bandit 设定。在该分段 i.i.d. 设定中,存在有限个变点,在变点处部分或所有臂的均值同时改变。我们将 \citet{wu2016conservative} 中研究的安全约束引入该设定,使得在任意轮次累积奖励高于默认动作奖励的常数倍。我们针对该设定提出两种主动自适应算法,满足安全约束、检测变点并在不知变点数量或位置的情况下重启。我们给出了算法的后悔界,并表明这些界与安全和分段 i.i.d. bandit 文献中的对应结果相当。我们还给出了该设定的首个匹配下界。在实证上,我们展示了我们的安全感知算法性能与不满足安全约束的最先进主动自适应算法相近。
引用
@article{arxiv.2205.13689,
title = {Safety Aware Changepoint Detection for Piecewise i.i.d. Bandits},
author = {Subhojyoti Mukherjee},
journal= {arXiv preprint arXiv:2205.13689},
year = {2022}
}
备注
Accepted for the 38th Conference on Uncertainty in Artificial Intelligence (UAI 2022)