中文

面向 CTR 预测的校准兼容型列表级特权特征蒸馏

信息检索 2023-12-15 v1

摘要

在机器学习系统中,特权特征是指在离线训练期间可用,但在在线服务期间无法访问的特征。以往的研究已经认识到特权特征的重要性,并探索了解决线上线下差异的方法。一种典型的做法是特权特征蒸馏(PFD):使用所有特征(包括特权特征)训练一个教师模型,然后使用一个学生模型(排除特权特征)从教师模型中蒸馏知识,该学生模型随后用于在线服务。在实践中,PFD 通常采用逐点交叉熵损失。然而,这种损失不足以蒸馏 CTR 预测的排序能力。首先,它没有考虑数据分布的非独立同分布特性,即同一页面上的其他项目会显著影响候选项目的点击概率。其次,它未能考虑教师模型预测排序的相对项目顺序,这对于蒸馏排序能力至关重要。为了解决这些问题,我们首先将基于逐点的 PFD 扩展为基于列表的 PFD。然后,我们定义了蒸馏损失的校准兼容属性,并表明常用的列表级损失在用作蒸馏损失时不满足该属性,从而损害了模型的校准能力,而这是 CTR 预测的另一个重要衡量标准。为了解决这一困境,我们提出了校准兼容型列表级蒸馏(CLID),它采用精心设计的列表级蒸馏损失,在保持模型校准能力的同时,实现了比基于逐点的 PFD 更好的排序能力。我们从理论上证明了它是校准兼容的。在公开数据集和从阿里巴巴展示广告系统收集的生产数据集上的大量实验进一步证明了 CLID 的有效性。

关键词

引用

@article{arxiv.2312.08727,
  title  = {Calibration-compatible Listwise Distillation of Privileged Features for CTR Prediction},
  author = {Xiaoqiang Gui and Yueyao Cheng and Xiang-Rong Sheng and Yunfeng Zhao and Guoxian Yu and Shuguang Han and Yuning Jiang and Jian Xu and Bo Zheng},
  journal= {arXiv preprint arXiv:2312.08727},
  year   = {2023}
}

备注

This paper has been accepted by WSDM'24