面向连续臂赌博机问题的离线策略评估探索
机器学习
2019-08-22 v1 机器学习
摘要
(上下文)多臂赌博机问题(MAB)形式化了具有众多应用的序贯决策过程。然而,有效地评估 MAB 策略具有挑战性;我们要么诉诸于本质上包含可疑假设的模拟,要么诉诸于昂贵的现场试验。近来提出了一种基于经验数据的离线评估方法,从而放宽了假设,并可用于并行评估多个竞争策略。然而,该方法并不直接适用于连续臂(CAB)问题;这是 MAB 问题的一个常见变体,其动作集是连续的而非离散的。我们提出并评估了对现有方法的扩展,使其可用于评估 CAB 策略。我们通过实证证明,我们的方法提供了相对一致的策略排序。此外,我们详述了如何将我们的方法用于真实 CAB 问题中的策略选择。
引用
@article{arxiv.1908.07808,
title = {Exploring Offline Policy Evaluation for the Continuous-Armed Bandit Problem},
author = {Jules Kruijswijk and Petri Parvinen and Maurits Kaptein},
journal= {arXiv preprint arXiv:1908.07808},
year = {2019}
}