基于强化学习推荐系统的生成对抗用户模型
机器学习
2020-01-03 v3 信息检索
机器学习
摘要
将强化学习(RL)应用于推荐系统既有浓厚兴趣也面临诸多挑战。在此设定中,在线用户即环境;奖励函数与环境动力学均未被明确定义,使得 RL 的应用颇具挑战。本文中,我们提出了一种用于推荐系统的基于模型的新型强化学习框架,其中我们开发了生成对抗网络来模仿用户行为动力学并学习其奖励函数。使用该用户模型作为模拟环境,我们开发了新颖的级联 DQN 算法以获得组合推荐策略,该策略可高效处理大量候选物品。在使用真实数据的实验中,我们表明该生成对抗用户模型比替代方案能更好地解释用户行为,且基于该模型的 RL 策略可为用户带来更好的长期奖励并为系统带来更高的点击率。
引用
@article{arxiv.1812.10613,
title = {Generative Adversarial User Model for Reinforcement Learning Based Recommendation System},
author = {Xinshi Chen and Shuang Li and Hui Li and Shaohua Jiang and Yuan Qi and Le Song},
journal= {arXiv preprint arXiv:1812.10613},
year = {2020}
}