面向组合策略的无分布多臂老虎机研究
机器学习
2014-10-07 v3
摘要
本文通过允许在每个决策点对组成臂(constituent bandits)施加任意约束,研究了经典多臂老虎机(MABs)问题的广义版本。本研究的动机源于许多需要在不确定环境中反复做出受任意约束的选择的情境:例如,定期决定在线展示哪些广告以获得高点击率,而无需知晓用户偏好;或在天气和交通状况不确定的情况下,每天决定回家的路线。假设有 个未知的随机变量(RVs),即臂,每个臂随时间演化为一个\emph{i.i.d}随机过程。在每个决策时刻,我们选择一个策略,即随机变量的一个子集,该选择需满足对组成随机变量的任意约束。随后,我们获得一个奖励,该奖励是所选随机变量观测值的线性组合。此前针对该问题的结果性能严重依赖于相应学习策略所生成策略的分布。例如,如果最佳策略与次佳策略之间的奖励差趋近于零,先前的结果可能导致任意大的遗憾(regret)。同时,当每个决策点存在指数级数量的可能策略时,对先前无分布策略的天真扩展会导致在遗憾、计算和空间复杂度方面性能不佳。为此,我们提出了一种高效的无分布学习(DFL)策略,无论所得策略的概率分布如何,该策略都能实现零遗憾。我们的学习策略具有 的时间复杂度和 的空间复杂度。在后续推导中,我们表明即使在每个决策点寻找最优策略是 NP-hard 的,我们的策略仍允许近似解,同时保持接近零的遗憾。
引用
@article{arxiv.1307.5438,
title = {Towards Distribution-Free Multi-Armed Bandits with Combinatorial Strategies},
author = {Xiang-yang Li and Shaojie Tang and Yaqin Zhou},
journal= {arXiv preprint arXiv:1307.5438},
year = {2014}
}