中文

基于解耦通用值函数的强化学习在物品推荐中的应用

信息检索 2021-04-13 v2 机器学习

摘要

近年来,将强化学习(RL)应用于推荐系统(RS)既有浓厚兴趣也面临诸多挑战。本文总结了大规模基于RL的推荐系统的三个关键实际挑战:海量状态与动作空间、高方差环境,以及推荐中不明确奖励设置。现有文献对这些问题的探索甚少,使RL应用颇具挑战。我们开发了名为GoalRec的基于模型的强化学习框架。受世界模型(基于模型)、值函数估计(无模型)和基于目标的RL等思想启发,提出了一种为物品推荐设计的新型解耦通用值函数。它能泛化到推荐器可能拥有的各种目标,并相应地解耦随机环境动态与高方差奖励信号。作为值函数的一部分,一个高容量的独立于奖励的世界模型从稀疏且高方差的奖励信号中解放出来,被训练用于在给定目标下模拟复杂的环境动态。基于预测的环境动态,该解耦通用值函数关联到用户未来轨迹,而非单一状态和标量奖励。我们在系列仿真和真实应用中,针对上述三个实际挑战展示了GoalRec相对于先前方法的优越性。

关键词

引用

@article{arxiv.2104.02981,
  title  = {Reinforcement Learning with a Disentangled Universal Value Function for Item Recommendation},
  author = {Kai Wang and Zhene Zou and Qilin Deng and Runze Wu and Jianrong Tao and Changjie Fan and Liang Chen and Peng Cui},
  journal= {arXiv preprint arXiv:2104.02981},
  year   = {2021}
}

备注

9 pages, 4 figures, to be published in Proceedings of the AAAI Conference on Artificial Intelligence 2021