中文

缓解交互式推荐中离线强化学习的马太效应

信息检索 2023-07-11 v1

摘要

离线强化学习(RL)是一种从记录数据中离线学习策略而无需与在线环境交互的技术,已成为交互式推荐等决策过程中的优选方案。离线 RL 面临价值高估问题。为解决该问题,现有方法采用保守主义,例如通过将所学策略约束为接近行为策略或惩罚极少访问的状态-动作对。然而,当将此类离线 RL 应用于推荐时,会通过推广热门物品或类别同时抑制较冷门者,导致严重的马太效应,即富者愈富、穷者愈穷。这是在实用推荐系统中亟需解决的一个臭名昭著的问题。本文中,我们旨在缓解基于离线 RL 的推荐中的马太效应。通过理论分析,我们发现现有方法的保守主义在追求用户长期满意度方面失效。这启发我们添加一个惩罚项,以放宽对记录策略高熵状态的悲观估计,并间接惩罚导致多样性较低状态的动作。这构成了本工作的主要技术贡献:去偏基于模型的离线 RL(DORL)方法。实验表明,DORL 不仅能很好地捕捉用户兴趣,还能缓解马太效应。实现可通过 https://github.com/chongminggao/DORL-codes 获取。

关键词

引用

@article{arxiv.2307.04571,
  title  = {Alleviating Matthew Effect of Offline Reinforcement Learning in Interactive Recommendation},
  author = {Chongming Gao and Kexin Huang and Jiawei Chen and Yuan Zhang and Biao Li and Peng Jiang and Shiqi Wang and Zhong Zhang and Xiangnan He},
  journal= {arXiv preprint arXiv:2307.04571},
  year   = {2023}
}

备注

SIGIR 2023 Full Paper