中文

面向上下文推荐的策略梯度方法

机器学习 2019-03-05 v3

摘要

决策是在线推荐系统中的一个具有挑战性的任务。决策者常常需要在每一步从候选集中选择一个上下文项目。上下文bandit算法已成功部署于此类应用中,以权衡探索与利用,并在最小化在线代价方面具有最先进的性能。然而,现有上下文bandit方法的适用性受到问题过度简化假设的限制,例如假设奖励函数形式简单,或假设环境静态且状态不受先前动作影响。在这项工作中,我们提出面向上下文推荐的策略梯度(PGCR)以在无这些不现实假设下解决问题。它在一类受限策略上优化,其中选择某项目的边际概率(对其他项目的期望下)具有简单的闭式形式,且该类策略下期望收益的梯度形式简洁。此外,PGCR利用了两种称为时间依赖贪婪与Actor-Dropout的有用启发式技术。前者确保PGCR在极限下经验性地贪婪,后者通过使用带Dropout的策略网络作为贝叶斯近似来应对探索与利用的权衡。PGCR可解决标准上下文bandit及其马尔可夫决策过程推广。因此,它可应用于广泛的现实推荐场景,例如个性化广告。我们在玩具数据集以及真实世界的个性化音乐推荐数据集上评估PGCR。实验表明,PGCR实现了快速收敛与低遗憾,并优于经典上下文bandit与朴素策略梯度方法。

关键词

引用

@article{arxiv.1802.04162,
  title  = {Policy Gradients for Contextual Recommendations},
  author = {Feiyang Pan and Qingpeng Cai and Pingzhong Tang and Fuzhen Zhuang and Qing He},
  journal= {arXiv preprint arXiv:1802.04162},
  year   = {2019}
}

备注

Accepted at WWW-2019