ResAct:利用残差 actor 强化序列推荐中的长期参与
信息检索
2023-06-19 v2 机器学习
摘要
在序列推荐中,长期参与优于即时参与,因其直接影响日活跃用户(DAUs)和停留时间等产品运营指标。同时,强化学习(RL)被广泛视为优化序列推荐中长期参与的有前景框架。然而,由于昂贵的在线交互,RL算法在优化长期参与时很难进行状态-动作价值估计、探索与特征提取。本文提出ResAct,其寻求一个接近但优于在线服务策略的策略。如此,我们可在所学策略附近收集充足数据,从而恰当估计状态-动作价值,且无需进行在线探索。ResAct通过先重建在线行为、再通过残差Actor改进之来优化策略。为提取长期信息,ResAct利用两个信息论正则化项以保证特征的表征力与简洁性。我们在基准数据集和由数千万推荐请求组成的大规模工业数据集上实验。实验结果表明,我们的方法在各种长期参与优化任务中显著优于最先进基线。
引用
@article{arxiv.2206.02620,
title = {ResAct: Reinforcing Long-term Engagement in Sequential Recommendation with Residual Actor},
author = {Wanqi Xue and Qingpeng Cai and Ruohan Zhan and Dong Zheng and Peng Jiang and Kun Gai and Bo An},
journal= {arXiv preprint arXiv:2206.02620},
year = {2023}
}
备注
Accpetd by ICLR 2023