中文

MAC:多归因机制下的转化率预测基准数据集

机器学习 2026-03-03 v1 人工智能

摘要

多归因学习(MAL)通过学习来自多个归因机制产生的转换标签来提升模型性能,已成为转化率(CVR)预测的有前景的学习范式。然而,公开的 CVR 数据集中的转换标签由单一归因机制生成,阻碍了 MAL 方法的发展。为解决这一数据差距,我们建立了多归因基准(MAC),这是第一个包含来自多个归因机制标签的公开 CVR 数据集。此外,我们开发了 PyMAL,一个开源库,涵盖广泛的基线方法,以促进 MAL 的可重复研究。我们对 MAC 进行了全面的实验分析,揭示了三个关键见解:(1)在不同归因设置下,MAL 均带来一致的性能提升,尤其适用于具有长转化路径的用户。(2)性能增长在大多数设置下随目标复杂度而提升;然而,在预测首次点击转换目标时,仅简单增加辅助目标反而适得其反,这凸显了对辅助目标谨慎选择的必要性。(3)两个架构设计原则至关重要:首先,充分学习多归因知识;其次,充分利用这种知识服务于主任务。针对这些发现,我们提出了混合不对称专家(MoAE),一种有效的 MAL 方法,融合了多归因知识学习和主任务导向的知识利用。在 MAC 上的实验表明,MoAE 显著超越了现有的领先 MAL 方法。我们相信,我们的基准数据集和见解将推动 MAL 领域的未来研究。我们的 MAC 基准数据集和 PyMAL 算法库已公开于 https://github.com/alimama-tech/PyMAL。

关键词

引用

@article{arxiv.2603.02184,
  title  = {MAC: A Conversion Rate Prediction Benchmark Featuring Labels Under Multiple Attribution Mechanisms},
  author = {Jinqi Wu and Sishuo Chen and Zhangming Chan and Yong Bai and Lei Zhang and Sheng Chen and Chenghuan Hou and Xiang-Rong Sheng and Han Zhu and Jian Xu and Bo Zheng and Chaoyou Fu},
  journal= {arXiv preprint arXiv:2603.02184},
  year   = {2026}
}

备注

Code and data available at https://github.com/alimama-tech/PyMAL