中文

REINFORCE 推荐系统中面向用户满意度的奖励塑形

信息检索 2022-10-03 v1 人工智能 机器学习

摘要

我们应如何设计基于强化学习(Reinforcement Learning, RL)的推荐系统,以促使将用户轨迹与底层用户满意度相对齐?三个关键研究问题是:(1) 度量用户满意度,(2) 缓解满意度信号的稀疏性,以及 (3) 调整推荐智能体的训练以最大化满意度。对于度量,研究发现通过调查直接询问用户对消费条目的体验评分,可提供与参与/交互数据正交的宝贵信息,作为底层用户满意度的代理。对于稀疏性,即仅能观察用户对极小部分用户-条目交互的满意度,插补模型可用于预测用户已消费所有条目的满意度水平。为学习令人满意的推荐策略,我们假定 RL 推荐智能体中的奖励塑形(reward shaping)对驱动令人满意的用户体验十分有效。综合上述,我们提出联合学习策略网络与满意度插补网络:插补网络的作用是学习哪些动作令用户满意;而基于 REINFORCE 构建的策略网络决定推荐哪些条目,其奖励利用插补得到的满意度。我们在工业级大规模推荐平台上通过离线分析与在线实验,展示了该方法在令人满意的用户体验方面的前景。

关键词

引用

@article{arxiv.2209.15166,
  title  = {Reward Shaping for User Satisfaction in a REINFORCE Recommender},
  author = {Konstantina Christakopoulou and Can Xu and Sai Zhang and Sriraj Badam and Trevor Potter and Daniel Li and Hao Wan and Xinyang Yi and Ya Le and Chris Berg and Eric Bencomo Dixon and Ed H. Chi and Minmin Chen},
  journal= {arXiv preprint arXiv:2209.15166},
  year   = {2022}
}

备注

Accepted in Reinforcement Learning for Real Life (RL4RealLife) Workshop in the 38th International Conference on Machine Learning, 2021