基于传统与深度学习模型的阿里巴巴淘宝广告数据集CTR预测
机器学习
2025-12-01 v1
摘要
点击-through率预测在现代广告系统中至关重要,排名相关性和用户参与度直接影响平台效率和商业价值。本项目探索如何使用阿里巴巴发布的大型淘宝数据集更有效地建模CTR。我们首先使用监督学习模型,包括逻辑回归和Light-GBM,这些模型在基于用户人口统计信息、广告属性和上下文元数据的静态特征上进行训练。这些模型提供快速、可解释的基准,但捕捉驱动点击的行为模式能力有限。为更好地建模用户意图,我们结合了来自数亿次交互、持续22天的行为数据。通过提取和编码用户行为序列,我们构建用户兴趣随时间变化的表示。我们使用深度学习模型融合行为嵌入与静态特征,其中多层感知器(MLP)取得了显著的性能提升。为捕捉时间动态,我们设计了基于Transformer的架构,使用自注意力机制学习行为序列中的上下文依赖,建模不仅关注用户交互的内容,还关注交互的时间和频率。Transformer相对于基线(LR模型)提高了2.81%的AUC,对于兴趣多样或随时间变化的用户获得了最大提升。除了建模,我们提出了用于实际评估的A/B测试策略。我们也思考了更广泛的意义:个性化广告定位技术可应用于公共卫生场景,以实现健康信息或行为指导的精准投递。我们的研究为推进点击-through率预测以及将其价值延伸至电子商务提供了路线图。
引用
@article{arxiv.2511.21963,
title = {CTR Prediction on Alibaba's Taobao Advertising Dataset Using Traditional and Deep Learning Models},
author = {Hongyu Yang and Chunxi Wen and Jiyin Zhang and Nanfei Shen and Shijiao Zhang and Xiyan Han},
journal= {arXiv preprint arXiv:2511.21963},
year = {2025}
}