中文

AntM²C:一个用于多场景多模态CTR预测的大规模数据集

信息检索 2023-09-01 v1 机器学习

摘要

点击率(CTR)预测是推荐系统中的关键问题。各类公开CTR数据集已然涌现。然而,现有数据集主要存在如下局限。首先,用户通常从多场景点击不同类型物品,多场景建模可提供更全面的用户理解;现有数据集仅含单一场景同类物品数据。其次,多模态特征在多场景预测中至关重要,其解决不同场景间ID编码不一致问题;现有数据集基于ID特征且缺乏多模态特征。第三,大规模数据集可提供更可靠的模型评估,充分反映模型间性能差异;现有数据集规模约1亿,相较真实CTR预测偏小。为克服这些局限,我们提出AntM²C,一个基于支付宝工业数据的多场景多模态CTR数据集。具体而言,AntM²C提供以下优势:1)覆盖5类不同物品的CTR数据,揭示用户对广告、代金券、小程序、内容与视频等不同物品的偏好;2)除基于ID的特征外,AntM²C还提供原始文本与图像两种多模态特征,可有效建立不同ID物品间联系;3)AntM²C提供10亿CTR数据、200特征,含2亿用户与600万物品,是当前最大规模CTR数据集。基于AntM²C,我们构建若干典型CTR任务并提供与基线方法的比较。数据集主页见https://www.atecup.cn/home。

关键词

引用

@article{arxiv.2308.16437,
  title  = {AntM$^{2}$C: A Large Scale Dataset For Multi-Scenario Multi-Modal CTR Prediction},
  author = {Zhaoxin Huan and Ke Ding and Ang Li and Xiaolu Zhang and Xu Min and Yong He and Liang Zhang and Jun Zhou and Linjian Mo and Jinjie Gu and Zhongyi Liu and Wenliang Zhong and Guannan Zhang},
  journal= {arXiv preprint arXiv:2308.16437},
  year   = {2023}
}