不安马尔可夫多臂老虎机中的最优臂辨识
机器学习
2022-03-30 v1 信息论
机器学习
math.IT
摘要
我们研究在多臂老虎机环境中辨识最优臂的问题,其中每个臂是在公共有限状态空间上的时间齐次且遍历的离散时间马尔可夫过程。每个臂上的状态演化由其转移概率矩阵(TPM)支配。一个知道臂TPM集合但不知道TPM到臂的确切映射的决策实体,希望尽快找到最优臂的索引,且错误概率有上界。该决策实体依次每次选择一个臂,所有未被选择的臂继续经历状态演化(不安(restless)臂)。对于此问题,我们推导了已知的首个依赖于问题实例的渐近下界,关于寻找最优臂索引所需期望时间的增长率,其中渐近为错误概率趋于零时。此外,我们提出一种顺序策略,对于输入参数,强制选择一个连续个时间瞬间未被选择的臂。我们证明该策略达到一个依赖于的上界,且当时单调非增。一般而言,当时上界的极限值是否与下界匹配,这一问题仍然开放。我们确定了一个上下界匹配的特例。先前关于最优臂辨识的工作处理了(a)来自臂的独立同分布观测,以及(b)休息(rested)马尔可夫臂,而我们的工作处理了更困难的不安马尔可夫臂设定。
引用
@article{arxiv.2203.15236,
title = {Best Arm Identification in Restless Markov Multi-Armed Bandits},
author = {P. N. Karthik and Kota Srinivas Reddy and Vincent Y. F. Tan},
journal= {arXiv preprint arXiv:2203.15236},
year = {2022}
}
备注
41 pages