中文

基于臂切换限制的多臂_bandit 过程一般框架

概率论 2021-12-28 v2 机器学习 最优化与控制 机器学习

摘要

本文通过引入一类对连续时间演化的臂之间切换的限制,提出了多臂_bandit(MAB)过程的一般框架。针对受切换限制的单臂构造了 Gittins 指数过程,并由此确立了相应 Gittins 指数规则的最优性。本文定义的 Gittins 指数与连续时间、整数时间、半马尔可夫设定以及一般离散时间设定下的 MAB 过程指数一致,从而新理论将经典模型涵盖为特例,并适用于文献中尚未触及的许多其他情形。尽管 Gittins 指数策略最优性的证明得益于现有连续时间 MAB 过程理论的思想,但引入了大幅简化证明的新技术。

关键词

引用

@article{arxiv.1808.06314,
  title  = {A General Framework of Multi-Armed Bandit Processes by Arm Switch Restrictions},
  author = {Wenqing Bao and Xiaoqiang Cai and Xianyi Wu},
  journal= {arXiv preprint arXiv:1808.06314},
  year   = {2021}
}

备注

27 pages, 0 figures