中文

多臂老虎机中随时间调控贪婪性

机器学习 2021-02-16 v4 机器学习

摘要

在零售中,客户行为存在可预测但显著的时间依赖模式,例如访客数量的周期性变化,或主要节假日前客户的增加。当前多臂老虎机分析范式未考虑这些已知模式。这意味着对于价格在特定时段固定的零售应用,当前的bandit算法不够用。本工作提供了一种考虑时间依赖模式的补救方法,并展示了该方法如何在UCB、ε\varepsilon-greedy和UCB-L算法中实施,以及通过一种称为可变臂池算法(variable arm pool algorithm)的新策略实施。在修正的方法中,利用(贪婪)随时间被调节,以便在较高奖励时段发生更多利用,在较低奖励时段发生更多探索。为了理解为何修正方法的后悔值降低,我们提出了一组界限,以洞察为何要在高奖励时段利用,并讨论对后悔值的影响。我们提出的方法在实验中表现良好,且灵感来自使用Yahoo!! Front Page数据的Exploration and Exploitation 3竞赛中的高分条目。该条目大量使用时间序列方法来随时间调节贪婪,其效果远优于其他上下文老虎机方法。

关键词

引用

@article{arxiv.1505.05629,
  title  = {Regulating Greed Over Time in Multi-Armed Bandits},
  author = {Stefano Tracà and Cynthia Rudin and Weiyu Yan},
  journal= {arXiv preprint arXiv:1505.05629},
  year   = {2021}
}

备注

Published in JMLR (Journal of Machine Learning Research). The paper contains algorithms, theorems, proofs, and experimental results with synthetic and real data. url: http://jmlr.org/papers/v22/17-720.html