TWIN V2:面向增强点击率预测的超长用户行为序列建模在快手的应用
信息检索
2024-08-19 v2 人工智能
摘要
建模长期用户兴趣以提高大规模推荐系统中点击率预测任务的重要性正在逐渐受到研究人员和实践者的关注。现有工作(如SIM和TWIN)通常采用两阶段方法来建模长期用户行为序列以解决效率问题。第一阶段使用基于搜索的机制(称为通用搜索单元GSU)从长序列中快速检索与目标项目相关的子集序列;第二阶段在检索结果上使用精确搜索单元ESU计算兴趣得分。鉴于用户行为序列可达规模的寿命周期长度,目前尚无有效方案能完全建模此类宏大的用户兴趣。为克服此问题,我们引入TWIN-V2,这是TWIN的一个改进版本,采用分治方法压缩寿命周期行为并发现更准确和更丰富的用户兴趣。具体而言,层次聚类方法在离线阶段将具有相似特征的项目聚合到单个簇中。通过限制簇的大小,我们可以将行为序列压缩到超过的规模,以便在GSU检索中实现在线推断。聚类感知目标注意力提取用户的全面且多面的长期兴趣,从而使最终推荐结果更加准确和多样。大量离线实验基于规模为数十亿的工业数据集,以及在线A/B测试均证明了TWIN-V2的有效性。在高效部署框架下,TWIN-V2已成功部署至服务数亿日活用户的主流流量。
引用
@article{arxiv.2407.16357,
title = {TWIN V2: Scaling Ultra-Long User Behavior Sequence Modeling for Enhanced CTR Prediction at Kuaishou},
author = {Zihua Si and Lin Guan and ZhongXiang Sun and Xiaoxue Zang and Jing Lu and Yiqun Hui and Xingchao Cao and Zeyu Yang and Yichen Zheng and Dewei Leng and Kai Zheng and Chenbin Zhang and Yanan Niu and Yang Song and Kun Gai},
journal= {arXiv preprint arXiv:2407.16357},
year = {2024}
}
备注
Accepted by CIKM 2024