中文

非随机多臂老虎机问题中基于专家建议的紧下界

机器学习 2025-11-04 v1 机器学习

摘要

我们确定经典非随机多臂老虎机问题中针对专家建议的最小混沌期预期后悔的最小值,通过证明一个与Kale(2014)的上界相匹配的下界。这两个界限确定了混沌期预期后悔的最小值行为为Θ(TKlog(N/K))\Theta\left( \sqrt{T K \log (N/K) } \right),其中KK为臂数,NN为专家数,TT为时间范围。

关键词

引用

@article{arxiv.2511.00257,
  title  = {A Tight Lower Bound for Non-stochastic Multi-armed Bandits with Expert Advice},
  author = {Zachary Chase and Shinji Ito and Idan Mehalel},
  journal= {arXiv preprint arXiv:2511.00257},
  year   = {2025}
}