中文

面向十万级用户行为序列的端到端推荐:抖音大规模推荐系统的实现

机器学习 2026-05-20 v3 信息检索

摘要

短视频推荐系统如抖音必须在不破坏延迟或成本预算的前提下利用极长的用户行为历史。我们提出了一个面向生产环境的端到端推荐系统,将长序列推荐建模扩展到 10K 长度的历史记录。首先,我们引入堆叠目标到历史交叉注意力(STCA),用从目标到历史的堆叠交叉注意力取代历史自注意力,将序列长度相关的复杂度从二次降低到线性,使能够高效地在长用户行为序列上进行端到端训练。其次,我们提出请求级批处理(RLB)方案,通过聚合同一用户/请求的多个目标来共享用户端编码,显著降低与序列相关的存储、通信和计算开销,而不会改变学习目标。最后,我们设计一种长度外推训练策略——在较短的窗口上训练,在更长的序列上推理——使模型能够在不增加额外训练成本的情况下泛化到 10K 规模的历史记录。在离线和在线实验中,我们观察到随着历史长度和模型容量的增加,效果呈现可预测、单调的提升,类似于大语言模型中观察到的规模定律行为。在抖音全流量部署后,我们的系统在关键 engagement 指标上实现了显著的改进,同时满足了生产环境的延迟要求,展示了将端到端超长序列推荐扩展到 10K 规模的实用路径。

关键词

引用

@article{arxiv.2511.06077,
  title  = {Make It Long, Keep It Fast: End-to-End 10K Long User Behavior Sequence Modeling for Billion-Scale Douyin Recommendation},
  author = {Lin Guan and Jia-Qi Yang and Zhishan Zhao and Beichuan Zhang and Bo Sun and Xuanyuan Luo and Jinan Ni and Xiaowen Li and Yuhang Qi and Zhifang Fan and Hangyu Wang and Qiwei Chen and Yi Cheng and Feng Zhang and Xiao Yang},
  journal= {arXiv preprint arXiv:2511.06077},
  year   = {2026}
}

备注

WWW 2026. This work studies end-to-end 10K-scale long user behavior sequence modeling for billion-scale industrial recommendation on Douyin