中文

具有习惯化与恢复动力学的非平稳多臂老虎机

最优化与控制 2019-10-21 v3 机器学习

摘要

许多场景涉及序贯决策,即在每一时间步可选择一组动作,每个动作提供随机奖励,且每个动作的奖励分布初始未知。然而,频繁选择某一特定动作可能降低其期望奖励,而放弃选择某一动作可能使其期望奖励增加。此类非平稳现象在许多现实场景中均可观察到,例如旨在提高依从性的个性化医疗干预以及定向在线广告。尽管对于具有非平稳性的一般模型,寻找最优策略是 PSPACE 完全的,我们提出并分析了一类称为 ROGUE(Reducing or Gaining Unknown Efficacy)老虎机的新模型,我们在本文中表明该模型能够捕捉这些现象,且便于设计有效的策略。我们首先提出了针对这些模型参数的一致极大似然估计量。接着,我们构建了有限样本浓度界,由此导出一种上置信界策略,称为 ROGUE 上置信界(ROGUE-UCB)算法。我们证明,在适当条件下,ROGUE-UCB 算法实现了随时间对数增长的遗憾,而现有算法则导致线性遗憾。最后,我们使用来自旨在提高身体活动的个性化医疗依从性改善干预的真实数据进行数值实验。在该干预中,目标是优化每天发送给每个个体的信息选择(例如,提升信心型与增长知识型),以提高依从性和身体活动水平。结果表明,与现有算法相比,ROGUE-UCB 在遗憾和平均奖励方面表现更优,且与其他算法相比,使用 ROGUE-UCB 使每日步数增加约 1,000 步(约多步行半英里)。

关键词

引用

@article{arxiv.1707.08423,
  title  = {Non-Stationary Bandits with Habituation and Recovery Dynamics},
  author = {Yonatan Mintz and Anil Aswani and Philip Kaminsky and Elena Flowers and Yoshimi Fukuoka},
  journal= {arXiv preprint arXiv:1707.08423},
  year   = {2019}
}