中文

面向季节性环境的线性_bandit

机器学习 2020-04-29 v1 机器学习

摘要

上下文_bandit(contextual bandit)算法在推荐系统中极为流行且被广泛用于提供在线个性化推荐。一个常见的假设是奖励函数的平稳性,而在大多数现实应用中这一假设颇不现实。例如在音乐推荐场景中,人们的音乐品味会在万圣节或圣诞节等特定事件期间骤变,并在不久后恢复先前品味。因此我们亟需一种能迅速应对这些变化的算法。此外,我们希望利用在不同平稳期(其可能重现)已观测到的奖励,而无需从零重启学习过程。已有日益增多的文献探讨奖励非平稳性问题,提供了可快速适应变化环境的算法。然而据我们所知,尚无算法处理奖励函数的季节性变化。本文提出一种上下文_bandit算法,可检测并适应奖励函数的突变,并在环境回落至先前观测状态时利用已有估计。我们表明所提方法可胜过最先进的非平稳环境算法。我们在合成与真实数据集上进行了实验。

关键词

引用

@article{arxiv.2004.13576,
  title  = {A Linear Bandit for Seasonal Environments},
  author = {Giuseppe Di Benedetto and Vito Bellini and Giovanni Zappella},
  journal= {arXiv preprint arXiv:2004.13576},
  year   = {2020}
}