中文

强化用户-作者对在大型推荐系统中的终身交互价值

信息检索 2025-09-22 v2

摘要

推荐系统(RS)帮助用户找到感兴趣的内容,并将作者与目标受众连接起来。RS 领域的大多数研究往往侧重于准确预测用户的即时反馈(如点击率)或提高用户的长期参与度。然而,它们忽略了作者的影响以及用户-作者对的终身交互价值(LIV),这对于提高短视频平台社交社区的繁荣度尤为关键。目前,强化学习(RL)可以优化长期收益并已广泛应用于 RS 中。在本文中,我们引入 RL 来强化用户-作者对的终身交互价值(RLIV-UA),基于 UA 对的每次交互进行优化。为了解决 UA 交互之间的长间隔和 UA 空间的大规模问题,我们提出了一种新颖的稀疏跨请求交互马尔可夫决策过程(SCRI-MDP),并引入了相邻状态近似(ASA)方法来构建 RL 训练样本。此外,我们引入多任务评论家学习(MTCL)来捕获 UA 交互的渐进性(点击 -> 关注 -> 送礼),其中利用更密集的交互信号来补偿稀疏标签的学习。最后,设计了一个辅助监督学习任务以增强 RLIV-UA 模型的收敛性。在离线实验和在线 A/B 测试中,RLIV-UA 模型相比对比方法实现了更高的用户满意度和更高的平台利润。

关键词

引用

@article{arxiv.2507.16253,
  title  = {Reinforce Lifelong Interaction Value of User-Author Pairs for Large-Scale Recommendation Systems},
  author = {Yisha Li and Lexi Gao and Jingxin Liu and Xiang Gao and Xin Li and Haiyang Lu and Liyin Hong},
  journal= {arXiv preprint arXiv:2507.16253},
  year   = {2025}
}