中文

分段稳态线性bandit中接近Minimax最优的最佳臂识别

机器学习 2024-10-11 v1 人工智能 信息论 math.IT 机器学习

摘要

我们提出了一种新型分段稳态线性bandit(PSLB)模型,其中在每个改变点处,环境随机从未知概率分布中抽取情境,臂的质量由其在所有情境下的平均收益衡量.情境及其分布、以及改变点均未被agent知晓.我们设计了PSε\varepsilonBAI+^+,一种保证以概率1δ\geq 1-\delta识别ε\varepsilon-最优臂且所需样本数最少的算法.PSε\varepsilonBAI+^+由两个子程序PSε\varepsilonBAI和{\sc Na"ive ε\varepsilon-BAI}(Nε\varepsilonBAI)并行执行.PSε\varepsilonBAI主动检测改变点并对情境进行对齐,以促进臂识别过程.当PSε\varepsilonBAI和Nε\varepsilonBAI在并行中被恰当地利用时,PSε\varepsilonBAI+^+被证明具有有限的预期样本复杂度.通过证明下界,我们显示PSε\varepsilonBAI+^+的预期样本复杂度在对数因子上是最优的.我们通过数值实验将PSε\varepsilonBAI+^+与基线算法进行比较,证明其效率.我们的数理结果和数值实验都表明,PSε\varepsilonBAI+^+的有效性源于PSε\varepsilonBAI中嵌入的精细的改变检测和情境对齐程序.

关键词

引用

@article{arxiv.2410.07638,
  title  = {Almost Minimax Optimal Best Arm Identification in Piecewise Stationary Linear Bandits},
  author = {Yunlong Hou and Vincent Y. F. Tan and Zixin Zhong},
  journal= {arXiv preprint arXiv:2410.07638},
  year   = {2024}
}

备注

69 pages. Accepted to NeurIPS 2024