中文

基于仿真的强化学习自动生成音乐播放列表

机器学习 2023-10-16 v1 机器学习

摘要

播放列表个性化是音乐流媒体服务的常见功能,但协同过滤等传统技术依赖关于内容质量的显式假设来学习如何推荐。此类假设常导致离线模型目标与在线用户满意度指标之间的错位。本文提出一种强化学习框架,通过使用仿真的播放列表生成环境直接优化用户满意度指标,从而解决上述局限。利用该仿真器,我们开发并训练了一种改进的Deep Q-Network——动作头DQN(AH-DQN),以应对我们强化学习公式中巨大的状态与动作空间所带来的挑战。所得策略能够从庞大且动态的候选条目集合中做出推荐,以期最大化消费指标。我们通过使用在公开和专有流媒体数据集上训练的环境模型进行仿真,离线分析和评估智能体。我们展示了在在线A/B测试中,这些智能体相比基线方法带来了更好的用户满意度指标。最后,我们证明仿真器产生的性能评估与观测到的在线指标结果高度相关。

关键词

引用

@article{arxiv.2310.09123,
  title  = {Automatic Music Playlist Generation via Simulation-based Reinforcement Learning},
  author = {Federico Tomasi and Joseph Cauteruccio and Surya Kanoria and Kamil Ciosek and Matteo Rinaldi and Zhenwen Dai},
  journal= {arXiv preprint arXiv:2310.09123},
  year   = {2023}
}

备注

10 pages. KDD 23