重新思考大规模预排序系统:全链路跨域模型
信息检索
2023-10-13 v1 人工智能
机器学习
摘要
推荐系统和在线广告等工业系统已广泛采用多阶段架构,其被划分为若干级联模块,包括匹配、预排序、排序和重排序。作为匹配与排序之间的关键桥梁,现有预排序方法主要因忽视全链路数据依赖而承受样本选择偏差(SSB)问题,导致次优性能。本文从全样本空间视角重新思考预排序系统,并提出全链路跨域模型(Entire-chain Cross-domain Models, ECM),其利用来自整个级联阶段的样本有效缓解SSB问题。此外,我们设计了一种名为ECMM的细粒度神经结构以进一步提升预排序精度。具体而言,我们提出跨域多塔神经网络以全面预测各阶段结果,并引入带正则化的子网络路由策略以降低计算成本。基于真实大规模流量日志的评估表明,我们的预排序模型在耗时维持在可接受水平的同时优于SOTA方法,实现了效率与效果之间更好的权衡。
引用
@article{arxiv.2310.08039,
title = {Rethinking Large-scale Pre-ranking System: Entire-chain Cross-domain Models},
author = {Jinbo Song and Ruoran Huang and Xinyang Wang and Wei Huang and Qian Yu and Mingming Chen and Yafei Yao and Chaosheng Fan and Changping Peng and Zhangang Lin and Jinghe Hu and Jingping Shao},
journal= {arXiv preprint arXiv:2310.08039},
year = {2023}
}
备注
5 pages, 2 figures