用于深度点击率预测的对抗梯度驱动探索
信息检索
2022-05-31 v2 机器学习
摘要
探索-利用(E{\&}E)算法通常被用于应对大规模在线推荐系统中的反馈循环问题。现有研究大多认为高不确定性可作为潜在奖励的良好指示,因而主要关注模型不确定性的估计。我们认为此类方法忽视了探索对模型训练的后续影响。从在线学习的视角看,探索策略的采用也会影响训练数据的收集,进而影响到模型学习。为理解探索与训练之间的相互作用,我们设计了一个伪探索模块,用于模拟在某个物品被探索并接收到相应反馈后模型的更新过程。我们进一步表明,该过程等价于向模型输入添加对抗扰动,因此将我们提出的方法命名为对抗梯度驱动探索(AGE)。为进行生产部署,我们提出一个动态门控单元来预先判定探索的效用。这使我们能够将有限的探索资源加以利用,并避免在无效探索上浪费页面浏览资源。AGE 的有效性首先通过在一个学术数据集上的大量消融研究得到验证。同时,AGE 也已部署于全球领先的展示广告平台之一,我们观察到各项顶层评估指标均有显著提升。
引用
@article{arxiv.2112.11136,
title = {Adversarial Gradient Driven Exploration for Deep Click-Through Rate Prediction},
author = {Kailun Wu and Zhangming Chan and Weijie Bian and Lejian Ren and Shiming Xiang and Shuguang Han and Hongbo Deng and Bo Zheng},
journal= {arXiv preprint arXiv:2112.11136},
year = {2022}
}
备注
This paper is accepted by the KDD2022