中文

不留任何人后盾:如何利用不完整和偏斜的多标签数据进行转化率预测

机器学习 2025-12-16 v1 人工智能 信息检索

摘要

在大多数实际的在线广告系统中,广告主通常具有多样化的客户获取目标。常见的解决方案是使用多任务学习(MTL)在点击后数据上训练统一模型,以估计这些目标的转化率(CVR)。在实际应用中,CVR 预测常常遇到缺失的转换数据,因为许多广告主仅提交用户部分转换动作的标签,due to 隐私或其他约束,导致多任务数据的标签不完整。如果模型在所有可用样本上训练,其中广告主提交用户转换动作的样本,部署时可能在为特定转换动作目标的子集广告主服务时表现不佳,因为训练和部署数据分布不匹配。尽管已做出大量 MTL 努力,但如何有效地利用不完整和偏斜的多标签数据进行训练长期以来一直是一个挑战。本文提出了一种针对非对称多标签数据的数据细粒度知识传递框架(KAML)。我们引入基于归因的掩码策略(ADM)以更好地利用非对称多标签数据进行训练。然而,ADM 中的较宽松掩码是一把双刃剑:它提供了额外的训练信号,但也因数据偏斜引入噪声。为解决此问题,我们提出了分层知识提取机制(HKE)来建模目标任务塔中的样本差异。最后,为了最大化未标记样本的效用,我们纳入排序损失策略进一步提升模型性能。通过在离线行业数据集和在线 A/B 测试中的全面评估,KAML 在现有 MTL 基线上实现了显著的性能提升。

关键词

引用

@article{arxiv.2512.13300,
  title  = {No One Left Behind: How to Exploit the Incomplete and Skewed Multi-Label Data for Conversion Rate Prediction},
  author = {Qinglin Jia and Zhaocheng Du and Chuhan Wu and Huifeng Guo and Ruiming Tang and Shuting Shi and Muyu Zhang},
  journal= {arXiv preprint arXiv:2512.13300},
  year   = {2025}
}