面向 BMO 函数的赌博机问题
机器学习
2020-07-20 v1 机器学习
摘要
我们研究底层期望奖励为有界平均振荡(Bounded Mean Oscillation, BMO)函数的赌博机(bandit)问题。BMO 函数可非连续且无界,适用于建模定义域中含无穷的信号。我们为 BMO 赌博机开发了一套工具,并给出一种算法,可实现 poly-log -regret——一种相对于在移除 大小臂空间后最优的臂所度量的后悔(regret)。
引用
@article{arxiv.2007.08703,
title = {Bandits for BMO Functions},
author = {Tianyu Wang and Cynthia Rudin},
journal= {arXiv preprint arXiv:2007.08703},
year = {2020}
}