非平稳隐_bandit问题
机器学习
2020-12-02 v1 人工智能
摘要
推荐系统的用户由于其偏好和品味随时间演变,常常表现出非平稳的行为。在这项工作中,我们提出了一种针对非平稳用户实现快速个性化的实用方法。其核心思想是将该问题构建为一个隐bandit问题,其中用户行为的原型模型离线学习,而用户的隐状态根据其与模型的交互在线推断。我们称此问题为非平稳隐bandit。我们提出了用于非平稳隐bandit中遗憾最小化的Thompson采样算法,对其进行了分析,并在真实世界数据集上进行了评估。我们方法的主要优势在于它可以与丰富的离线学习模型结合,这些模型可能存在误指定,随后通过后验采样进行在线微调。通过这种方式,我们自然地结合了离线学习与在线学习的优势。
引用
@article{arxiv.2012.00386,
title = {Non-Stationary Latent Bandits},
author = {Joey Hong and Branislav Kveton and Manzil Zaheer and Yinlam Chow and Amr Ahmed and Mohammad Ghavamzadeh and Craig Boutilier},
journal= {arXiv preprint arXiv:2012.00386},
year = {2020}
}
备注
15 pages, 4 figures