中文

行动胜于言语:千兆参数级顺序转换器用于生成式推荐

机器学习 2024-05-07 v3 信息检索

摘要

大型推荐系统以其依赖高基数、异构特征以及需在日常处理数十亿用户动作为特征。尽管在海量数据和数千特征下训练,行业内大多数深度学习推荐模型 (DLRM) 仍未实现计算规模。受 Transformer 在语言和视觉领域成功的启发,我们重新审视了推荐系统的基本设计选择。我们将推荐问题在生成式建模框架下重新表述为顺序转换任务("Generative Recommenders"),并提出一种新型架构 HSTU,专为高基数、非平稳流式推荐数据设计。HSTU 在合成数据和公开数据集上相较于基线方法在 NDCG 指标上提升最高可达 65.8%,在 8192 长度序列上相较于基于 FlashAttention2 的 Transformer 快 5.3 倍至 15.2 倍。基于 HSTU 的生成式推荐模型,规模达 1.5 万亿参数,在线 A/B 测试中指标提升 12.4%,已在拥有数十亿用户的大型互联网平台多个场景部署。更重要的是,生成式推荐模型的质量在训练计算提升至 GPT-3/LLaMa-2 规模(跨三个数量级)时,实证呈现出一种幂律规模关系,这降低了未来模型开发所需的碳足迹,并为 recommendations 领域的首个基础模型铺平了道路。

关键词

引用

@article{arxiv.2402.17152,
  title  = {Actions Speak Louder than Words: Trillion-Parameter Sequential Transducers for Generative Recommendations},
  author = {Jiaqi Zhai and Lucy Liao and Xing Liu and Yueming Wang and Rui Li and Xuan Cao and Leon Gao and Zhaojie Gong and Fangda Gu and Michael He and Yinghai Lu and Yu Shi},
  journal= {arXiv preprint arXiv:2402.17152},
  year   = {2024}
}

备注

26 pages, 13 figures. ICML'24. Code available at https://github.com/facebookresearch/generative-recommenders