中文

具有未知转移概率矩阵的不安分_bandit中固定置信度下的最优最佳臂辨识

机器学习 2024-06-25 v2 信息论 机器学习 math.IT

摘要

我们研究具有有限臂的不安分多臂_bandit(restless multi-armed bandit)中的最佳臂辨识问题。每根臂生成的离散时间数据构成一个同质马尔可夫链,取值于一个公共的有限状态空间。每根臂中的状态转移由一个遍历转移概率矩阵(TPM)刻画,该矩阵属于单参数指数族TPM。各臂TPM的实值参数未知且属于给定空间。给定定义在臂公共状态空间上的函数ff,目标是以最少样本量辨识出最佳臂——即在臂平稳分布下ff平均值最大的臂——同时决策错误概率有上界(即固定置信度 regime)。我们在错误概率趋于零的渐近情形下建立了期望停止时间增长率的下界。此外,提出了一种最佳臂辨识策略,并证明其期望停止时间的渐近增长率与下界匹配。研究表明,追踪某一马尔可夫决策过程的长期行为及其状态-动作访问比例是分析逆命题与可达性界的关键要素。我们证明在任一策略下,状态-动作访问比例满足特定的近似流守恒约束,且这些比例在任何渐近最优策略下与下界所规定的最优比例一致。先前关于不安分_bandit中最佳臂辨识的研究聚焦于臂的独立观测、休息马尔可夫臂,以及具有已知臂TPM的不安分马尔可夫臂。相比之下,本工作是首个研究具有未知臂TPM的不安分_bandit中最佳臂辨识的工作。

关键词

引用

@article{arxiv.2310.13393,
  title  = {Optimal Best Arm Identification with Fixed Confidence in Restless Bandits},
  author = {P. N. Karthik and Vincent Y. F. Tan and Arpan Mukherjee and Ali Tajer},
  journal= {arXiv preprint arXiv:2310.13393},
  year   = {2024}
}

备注

Accepted to the IEEE Transactions on Information Theory