从长期视角优化音频推荐:一种强化学习方法
机器学习
2024-07-30 v3 人工智能
信息检索
系统与控制
系统与控制
机器学习
摘要
我们提出了一种部署于工业规模的新型播客推荐系统。该系统成功地为数亿听众优化了跨越数月的个性化收听历程。与普遍行业实践中为短期代理指标优化机器学习算法不同,该系统在 A/B 测试中显著提升了长期表现。本文深入阐述了我们的方法如何应对通常阻碍此类长期优化的归因、协调与度量挑战。为将这些实践洞见置于更广泛的学术框架中,我们转向强化学习(RL)。借助 RL 的语言,我们建立了用户与推荐系统之间反复关系的综合模型。进而,在该模型中,我们将自身方法识别为对现有推荐系统某一组件的策略改进更新,并通过定制化的价值函数与用户状态表示建模加以增强。示意性离线实验表明,与黑盒方法相比,这种专门化建模将数据需求降低了多达 120,000 倍。
引用
@article{arxiv.2302.03561,
title = {Optimizing Audio Recommendations for the Long-Term: A Reinforcement Learning Perspective},
author = {Lucas Maystre and Daniel Russo and Yu Zhao},
journal= {arXiv preprint arXiv:2302.03561},
year = {2024}
}