用于在线推荐的生成式逆深度强化学习
信息检索
2020-11-05 v1 人工智能
摘要
深度强化学习使智能体能够通过与环境动态交互来捕捉用户兴趣,已在推荐研究中引起极大关注。深度强化学习利用奖励函数学习用户兴趣并控制学习过程。然而,多数奖励函数系人工设计,它们或不切实际或不够精确,难以反映推荐问题的高变化性、高维与非线性属性,致使智能体难以学到生成最满意推荐的最优策略。为解决上述问题,我们提出一种新颖的生成式逆强化学习方法,即InvRec,其从用户行为中自动提取奖励函数,用于在线推荐。我们在在线平台VirtualTB上开展实验,并与若干SOTA方法比较,以证明所提方法的可行性与有效性。
引用
@article{arxiv.2011.02248,
title = {Generative Inverse Deep Reinforcement Learning for Online Recommendation},
author = {Xiaocong Chen and Lina Yao and Aixin Sun and Xianzhi Wang and Xiwei Xu and Liming Zhu},
journal= {arXiv preprint arXiv:2011.02248},
year = {2020}
}