中文

释放稀疏注意力在长期行为预测中的潜能

信息检索 2026-01-27 v1

摘要

近年来,大语言模型(LLM)的成功推动了在推荐系统中探索规模定律。然而,针对用户长序列行为建模的模型实际上在工业设置中部署具有挑战,因为标准自注意力机制的计算复杂度较高。尽管在其他领域提出了各种稀疏自注意力机制,但它们并不完全适用于推荐场景,因为用户行为表现出个人化和时间特征:不同用户具有不同的行为模式,而这些模式会随时间变化,这些用户的数据与其他领域的数据在分布上存在显著差异。为了应对这些挑战,我们提出 SparseCTR,一个专为 modeling 用户长期行为而设计的高效且有效的模型。具体而言,我们以个体化方式将行为序列分段,以避免分离连续行为并实现序列的并行处理。基于这些片段,我们提出了三分支稀疏自注意力机制,以共同识别用户的全局兴趣、兴趣转变和短期兴趣。此外,我们设计了通过可学习的、特定于头部的偏置系数的复合相对时间编码,更好地捕捉用户行为之间的序列和周期关系。广泛的实验结果表明,SparseCTR 不仅提高了效率,还优于最新的技术方法。更重要的是,它表现出明显的规模定律现象,在 FLOPs 三个数量级范围内保持性能提升。在在线 A/B 测试中,SparseCTR 将 CTR 提升 1.72%,将 CPM 提升 1.41%。我们的源代码已公开 https://github.com/laiweijiang/SparseCTR。

引用

@article{arxiv.2601.17836,
  title  = {Unleashing the Potential of Sparse Attention on Long-term Behaviors for CTR Prediction},
  author = {Weijiang Lai and Beihong Jin and Di Zhang and Siru Chen and Jiongyan Zhang and Yuhang Gou and Jian Dong and Xingxing Wang},
  journal= {arXiv preprint arXiv:2601.17836},
  year   = {2026}
}