中文

有限时域多臂老虎机问题的分解-协调方法

最优化与控制 2024-05-22 v2

摘要

最优求解多臂老虎机问题受维数灾难之苦。事实上,随着臂数与时域增加,求助于动态规划导致计算时间呈指数增长。我们引入一种分解-协调启发式方法 DeCo,将初始问题转化为并行协调的单臂老虎机问题。结果,我们得到关于臂数本质上线性的计算时间。此外,该分解提供了悔值的理论下界。对于双臂老虎机情形,动态规划给出精确解,其几乎被 DeCo 启发式匹配。而且,在至多 100 轮与 20 臂的数值模拟中,DeCo 优于经典算法(Thompson 采样与 Kullback-Leibler 上置信界),并几乎匹配 20 臂悔值的理论下界。

关键词

引用

@article{arxiv.2106.01165,
  title  = {Decomposition-Coordination Method for Finite Horizon Bandit Problems},
  author = {Michel de Lara and Benjamin Heymann and Jean-Philippe Chancelier},
  journal= {arXiv preprint arXiv:2106.01165},
  year   = {2024}
}