中文

奖励平衡再思考:提升基于推荐系统的离线强化学习

信息检索 2025-07-01 v2

摘要

离线强化学习(RL)已成为真实世界推荐系统中流行且有效的方法,使能够从历史数据中学习策略并捕获用户偏好。在离线 RL 中,奖励塑形面临重大挑战,过去的尝试旨在整合先验策略以不确定性以改进世界模型或惩罚探索不足的状态-动作对。尽管有此等努力,仍存一个关键缺口:即同时平衡世界模型中的内在偏见与策略推荐的多样性。为此,我们提出一种创新的离线 RL 框架,称为用于推荐系统的重新分配奖励(Reallocated Reward for Recommender Systems, R3S)。通过整合内在模型不确定性以解决奖励预测中的内在波动,我们提升了决策的多样性,以更互动的方式整合额外惩罚项,随时间衰减,以抑制导致状态多样性降低的动作,这种惩罚在局部和全局尺度上均适用。实验结果表明,R3S 改进了世界模型的准确性,并有效地调和了用户的异构偏好。

关键词

引用

@article{arxiv.2506.22112,
  title  = {Reward Balancing Revisited: Enhancing Offline Reinforcement Learning for Recommender Systems},
  author = {Wenzheng Shu and Yanxiang Zeng and Yongxiang Tang and Teng Sha and Ning Luo and Yanhua Cheng and Xialong Liu and Fan Zhou and Peng Jiang},
  journal= {arXiv preprint arXiv:2506.22112},
  year   = {2025}
}

备注

Accepted in Companion Proceedings of the ACM Web Conference 2025