中文

用于短视频推荐的两阶段约束 Actor-Critic 方法

机器学习 2024-01-10 v3 信息检索

摘要

短视频在社交媒体上的广泛流行,为优化视频分享平台上的推荐系统带来了新机遇与挑战。用户与系统顺序交互,并提供复杂且多维的反馈,包括观看时长以及对多个视频的各类互动。一方面,平台旨在长期优化用户累计观看时长(主目标),这可由强化学习有效优化;另一方面,平台还需满足容纳多种用户互动反馈(辅助目标)的约束,如关注、分享等。本文将短视频推荐问题建模为约束马尔可夫决策过程(CMDP)。我们发现传统约束强化学习算法在此设定下表现不佳。我们提出一种新颖的两阶段约束 actor-critic 方法:第一阶段,学习个体策略以优化各辅助信号;第二阶段,学习一个策略以(i)优化主信号,且(ii)贴近第一阶段所学策略,从而有效保证该主策略在辅助目标上的表现。通过大量离线评估,我们证明了相较其他方法,本方法在优化主目标及平衡其余目标上的有效性。我们进一步在短视频推荐的线上实验中展示了本方法的优势,其在观看时长与互动方面均显著优于其他基线。我们的方法已在生产系统中全量上线,以优化平台上的用户体验。

关键词

引用

@article{arxiv.2302.01680,
  title  = {Two-Stage Constrained Actor-Critic for Short Video Recommendation},
  author = {Qingpeng Cai and Zhenghai Xue and Chi Zhang and Wanqi Xue and Shuchang Liu and Ruohan Zhan and Xueliang Wang and Tianyou Zuo and Wentao Xie and Dong Zheng and Peng Jiang and Kun Gai},
  journal= {arXiv preprint arXiv:2302.01680},
  year   = {2024}
}

备注

Code Available at https://github.com/AIDefender/TSCAC. arXiv admin note: substantial text overlap with arXiv:2205.13248