RecoMind:用于优化推荐系统中用户满意度的强化学习框架
机器学习
2025-08-04 v1
摘要
现有的大规模推荐系统通常使用监督学习方法,优先考虑即时用户反馈。尽管强化学习(RL) 提出了解决优化更长期目标(如会话内参与度)的方案,但在大规模应用中由于动作空间极大且工程复杂性高而受到限制。本文介绍 RecoMind,一个面向大规模会话目标优化的仿真器基 RL 框架。RecoMind 利用现有的推荐模型建立仿真环境,并从一开始就引导 RL 策略以优化即时用户交互。这一方法能良好地集成到现有行业管道中,简化 RL 策略的训练和部署。此外,RecoMind 引入了自定义的探索策略,以高效地探索包含数亿物品的大规模动作空间。我们通过大量离线仿真和在线 A/B 测试对 RecoMind 进行了评估。两种方法均表明,使用 RecoMind 训练的 RL 策略在会话内用户满意度方面显著优于传统监督学习推荐方法。在线 A/B 测试中,RL 策略使观看时长超过 10 秒的视频数量提高了 15.81%,会话深度提升了 4.71%(针对至少 10 次交互的会话)。因此,RecoMind 提供了一种系统且可扩展的方法,将 RL 嵌入大规模推荐系统中,显示出巨大的潜力用于优化会话基于用户满意度。
引用
@article{arxiv.2508.00201,
title = {RecoMind: A Reinforcement Learning Framework for Optimizing In-Session User Satisfaction in Recommendation Systems},
author = {Mehdi Ben Ayed and Fei Feng and Jay Adams and Vishwakarma Singh and Kritarth Anand and Jiajing Xu},
journal= {arXiv preprint arXiv:2508.00201},
year = {2025}
}