用于点击率预测的集成知识蒸馏
机器学习
2023-07-06 v2 信息检索
摘要
近年来,基于深度学习的模型被广泛研究用于点击率(CTR)预测,并在许多工业应用中提升了预测精度。然而,当前研究主要聚焦于构建复杂网络架构以更好地捕捉精细特征交互与动态用户行为。模型复杂度的增加可能拖慢在线推理,阻碍其在实时应用中的采用。与之不同,我们的工作致力于一种基于知识蒸馏(KD)的新模型训练策略。KD 是一种将教师模型所学知识的迁移至学生模型的师生学习框架。该 KD 策略不仅允许我们将学生模型简化为朴素 DNN 模型,还相较最先进的教师模型取得了显著的精度提升。上述收益促使我们进一步探索利用强大的教师集成以训练更精准的学生模型。我们还提出了若干新技术以促进集成式 CTR 预测,包括教师门控与基于蒸馏损失的早停。我们针对 12 个现有模型及三个工业数据集开展了全面实验。离线与在线 A/B 测试结果均表明了基于 KD 的训练策略的有效性。
引用
@article{arxiv.2011.04106,
title = {Ensemble Knowledge Distillation for CTR Prediction},
author = {Jieming Zhu and Jinyang Liu and Weiqi Li and Jincai Lai and Xiuqiang He and Liang Chen and Zibin Zheng},
journal= {arXiv preprint arXiv:2011.04106},
year = {2023}
}
备注
Published in CIKM'2020