离线强化学习推荐系统中的压缩特征
人工智能
2021-11-18 v1
摘要
在本文中,我们为某款游戏开发了一个推荐系统,该系统基于玩家的交互行为向其推荐潜在物品,以最大化游戏提供商的收入。我们的方法建立在基于强化学习的技术之上,并在 IEEE Big Data Cup 挑战赛公开可用的离线数据集上进行训练。离线数据集的局限性以及高维灾难给解决该问题带来了重大障碍。我们提出的方法通过应对这些主要困难来提升总奖励与性能。更具体地,我们利用稀疏 PCA 提取用户行为的重要特征。随后,我们基于 Q-learning 的系统从处理后的离线数据集进行训练。为充分利用所提供数据集中的全部可能信息,我们将用户特征聚类为不同组,并为每组构建独立的 Q-table。此外,为应对评估指标公式未知的挑战,我们设计了一种指标,基于游戏提供商可能获得的潜在价值以及从实时评分环境中获取的一小部分实际评估指标,来自我评估系统的性能。我们的实验表明,我们提出的指标与挑战赛组织者发布的结果一致。我们已实现所提出的训练流程,结果显示我们的方法在总奖励和训练速度方面均优于当前最先进(state-of-the-art, SOTA)方法。通过解决主要挑战并利用最先进技术,我们在该挑战赛中取得了最佳公开排行榜成绩。此外,我们提出的方法估计得分比当前最佳 SOTA 方法高出约 20%,且训练速度可快 30 倍。
引用
@article{arxiv.2111.08817,
title = {Compressive Features in Offline Reinforcement Learning for Recommender Systems},
author = {Hung Nguyen and Minh Nguyen and Long Pham and Jennifer Adorno Nieves},
journal= {arXiv preprint arXiv:2111.08817},
year = {2021}
}