LONGER:扩展工业推荐系统中的长序列建模
信息检索
2025-07-21 v2
摘要
对超长用户行为序列进行建模对于在工业推荐系统中捕捉长期和短期偏好至关重要。现有解决方案通常依赖于两阶段检索或间接建模范式,导致上下游不一致和计算效率低下。在本文中,我们提出了 LONGER,一种用于 GPU 高效推荐系统的长序列优化 Transformer。LONGER 结合了 用于在长上下文中稳定注意力机制的全局 token 机制, 包含轻量级 InnerTransformers 和混合注意力策略以降低二次复杂度的 token 合并模块,以及 一系列工程优化,包括混合精度训练和激活重计算、KV cache 服务,以及用于统一基于 GPU 的稠密和稀疏参数更新的完全同步的模型训练与服务框架。在字节跳动的广告和电子商务服务中,LONGER 在离线指标和在线 A/B 测试中均始终优于强基线,验证了其一致的有效性和工业级缩放定律。目前,LONGER 已在字节跳动超过 10 个有影响力的场景中全面部署,服务于十亿用户。
引用
@article{arxiv.2505.04421,
title = {LONGER: Scaling Up Long Sequence Modeling in Industrial Recommenders},
author = {Zheng Chai and Qin Ren and Xijun Xiao and Huizhi Yang and Bo Han and Sijun Zhang and Di Chen and Hui Lu and Wenlin Zhao and Lele Yu and Xionghang Xie and Shiru Ren and Xiang Sun and Yaocheng Tan and Peng Xu and Yuchao Zheng and Di Wu},
journal= {arXiv preprint arXiv:2505.04421},
year = {2025}
}