中文

结合路径规划的高效多元赌博机算法

机器学习 2022-08-19 v2 机器学习

摘要

在本文中,我们解决了当考虑臂维度层次结构时,多元多臂赌博机(Multivariate-MAB)问题中的臂指数爆炸问题。我们提出了一个称为路径规划(TS-PP)的框架,该框架利用决策图/树来建模具有 m 维交互作用的臂奖励成功率,并采用汤普森采样(TS)进行臂选择的启发式搜索。自然地,使用串行过程通过在每个过程中依次聚焦于一个维度来对抗维度灾难是相当直接的。据我们所知,我们是第一个使用图路径规划策略并部署类似蒙特卡洛树搜索思想来解决多元多臂赌博机问题的。我们提出的利用树模型的方法相比传统模型(如一般线性回归)具有优势。仿真研究通过实现更快的收敛速度、更好的高效最优臂分配和更低的累积遗憾验证了我们的主张。

关键词

引用

@article{arxiv.1909.02705,
  title  = {Efficient Multivariate Bandit Algorithm with Path Planning},
  author = {Keyu Nie and Zezhong Zhang and Ted Tao Yuan and Rong Song and Pauline Berry Burke},
  journal= {arXiv preprint arXiv:1909.02705},
  year   = {2022}
}

备注

Multi-Armed Bandit, Monte Carlo Tree Search, Decision Tree, Path Planning