OneRec:统一生成式推荐与迭代偏好对齐
信息检索
2025-02-27 v1
摘要
最近,基于生成式检索的推荐系统已成为一种有前景的范式。然而,大多数现代推荐系统采用检索-排序策略,其中生成式模型仅在检索阶段作为选择器发挥作用。本文提出 OneRec,取代了级联学习框架,实现统一的生成式模型。据我们所知,这是第一个在实际场景中显著超越当前复杂且精心设计的推荐系统的端到端生成式模型。具体而言,OneRec 包括:1)编码器-解码器结构,对用户的历史行为序列进行编码,并逐步解码用户可能感兴趣的视频。我们采用稀疏混合专家 (Mixture-of-Experts, MoE) 以不成比例增加计算 FLOPs 的方式扩大模型容量。2)基于会话的生成方法。与传统的逐项预测不同,我们提出会话级生成,该方法比依赖手工规则逐点生成更为优雅且上下文连贯。3)结合直接偏好优化 (Direct Preference Optimization, DPO) 的迭代偏好对齐模块,以提升生成结果的质量。不同于 NLP 中的 DPO,推荐系统通常只有一次机会为用户的浏览请求显示结果,无法同时获得正负样本。为此,我们设计奖励模型模拟用户生成,并定制抽样策略。大量实验表明,仅限数量的 DPO 样本即可对齐用户兴趣偏好,显著提升生成结果的质量。我们将 OneRec 部署在 Kuaishou 的主要场景中,实现了 1.6% 的观看时长提升,取得了显著的改进。
引用
@article{arxiv.2502.18965,
title = {OneRec: Unifying Retrieve and Rank with Generative Recommender and Iterative Preference Alignment},
author = {Jiaxin Deng and Shiyao Wang and Kuo Cai and Lejian Ren and Qigen Hu and Weifeng Ding and Qiang Luo and Guorui Zhou},
journal= {arXiv preprint arXiv:2502.18965},
year = {2025}
}