搜索转化率预测模型的规模化实践
信息检索
2026-05-29 v1
摘要
在高流量环境中扩展搜索转化率(CVR)预测模型 presents 一个挑战:需要在模型质量的提升与严格的训练成本和服务延迟约束之间进行权衡。本文详细阐述了扩展现代搜索 CVR 预测模型的有效方法。我们首先进行经验研究,以了解搜索 CVR 模型规模化性能,分析模型 backbone 计算、嵌入参数规模和训练数据量三个关键因素的 scaling 对质量提升的影响。我们使用来自高流量电商平台超过一年的客户交互日志的大规模生产数据集,评估了几种 state-of-the-art 架构及其集成的可扩展性。我们的关键发现包括:(1)选择合适的 backbone 和 scaling factors 至关重要;(2)扩大 backbone、嵌入和数据的影响在很大程度上是独立且可加性的,这对更高效的规模化探索具有意义;(3)一种简化的 warmstart 策略可加速训练迭代,同时简化新更新;(4)诸如解耦图执行和动态批处理等推理优化策略可即使为高容量模型实现低延迟 GPU 服务。相较于扩建前的生产模型基线,我们最终部署的模型在 2.5 倍的训练数据上进行训练,推理计算增强了 8 倍,同时对延迟几乎没有影响。在线 A/B 测试也表明,我们的发布实现了搜索转化率关键指标的 +2.6% 提升。
引用
@article{arxiv.2605.29232,
title = {On the Practice of Scaling Search Conversion Rate Prediction},
author = {James Pak and Jyun-Yu Jiang and Fan Zhang and Sen Wang and Taekmin Kim and Henry Tsai and Vijay Rajaram and Juexin Lin and Mohitdeep Singh and Alessandro Magnani and Johnny Chen and Qian Zhao and Rao Fu and Zhirong Liang and Jordan Gilliland and Winter Jiao},
journal= {arXiv preprint arXiv:2605.29232},
year = {2026}
}