面向短视频推荐的约束强化学习
机器学习
2022-05-27 v1 信息检索
摘要
短视频在社交媒体上的广泛流行,为优化视频分享平台上的推荐系统带来了新的机遇与挑战。用户对推荐表现出复杂且多维的响应,包括观看时长以及对视频的各类交互。因此,关注单一目标的既有推荐算法已不足以满足优化综合用户体验的新需求。本文将短视频推荐问题建模为约束马尔可夫决策过程(MDP),其中平台希望在长期优化用户观看时长这一主要目标的同时,满足容纳用户交互(如分享/下载视频)等辅助响应的约束。为解决该约束MDP,我们提出了一种基于 actor-critic 框架的两阶段强化学习方法。第一阶段,我们学习独立策略以优化各辅助响应。第二阶段,我们学习一个策略以(i)优化主要响应,且(ii)保持接近第一阶段学到的策略,从而有效保证该主要策略在辅助目标上的表现。通过大量仿真,我们证明了我们的方法相较于替代方法在优化主要目标及平衡其他目标上的有效性。我们进一步展示了我们的方法在短视频推荐线上实验中的优势,其在观看时长和视频播放交互方面显著优于其他基线。我们的方法已在生产系统中全面上线,以优化平台上的用户体验。
引用
@article{arxiv.2205.13248,
title = {Constrained Reinforcement Learning for Short Video Recommendation},
author = {Qingpeng Cai and Ruohan Zhan and Chi Zhang and Jie Zheng and Guangwei Ding and Pinghua Gong and Dong Zheng and Peng Jiang},
journal= {arXiv preprint arXiv:2205.13248},
year = {2022}
}