非参数随机上下文多臂老虎机
机器学习
2018-01-08 v1 机器学习
摘要
我们分析了臂老虎机问题,其中每臂的奖励是基于观测到的上下文在温和非参数假设下的含噪实现。我们针对最优臂辨识得到了紧致结果,并对一种易于实现的改进UCB算法(NN-UCB)给出了次线性后悔界,其中为上下文维度。随后我们给出了依赖于全局内在维度且与外在维度无关的后悔界。我们还讨论了基于期望老虎机性能恢复上下文空间中的拓扑结构,并提供了对无限臂上下文老虎机的扩展。最后,我们通过实验在模拟任务和MNIST图像分类上展示了我们的算法相对于现有多臂老虎机方法的改进。
引用
@article{arxiv.1801.01750,
title = {Nonparametric Stochastic Contextual Bandits},
author = {Melody Y. Guan and Heinrich Jiang},
journal= {arXiv preprint arXiv:1801.01750},
year = {2018}
}
备注
AAAI 2018