中文

面向 BMO 函数的赌博机问题

机器学习 2020-07-20 v1 机器学习

摘要

我们研究底层期望奖励为有界平均振荡(Bounded Mean Oscillation, BMO)函数的赌博机(bandit)问题。BMO 函数可非连续且无界,适用于建模定义域中含无穷的信号。我们为 BMO 赌博机开发了一套工具,并给出一种算法,可实现 poly-log δ\delta-regret——一种相对于在移除 δ\delta 大小臂空间后最优的臂所度量的后悔(regret)。

关键词

引用

@article{arxiv.2007.08703,
  title  = {Bandits for BMO Functions},
  author = {Tianyu Wang and Cynthia Rudin},
  journal= {arXiv preprint arXiv:2007.08703},
  year   = {2020}
}