面向推荐系统的基于图的模型无关数据子采样
信息检索
2023-06-19 v2 机器学习
社会与信息网络
摘要
数据子采样被广泛用于加速大规模推荐系统的训练。大多数子采样方法基于模型,常需要预训练的试点模型来通过例如样本难度衡量数据重要性。然而,当试点模型设定错误时,基于模型的子采样方法会退化。由于模型误设在实际推荐系统中持续存在,我们转而提出仅通过探索由图表示的输入数据结构来实现的模型无关数据子采样方法。具体而言,我们研究用户-物品图的拓扑结构,通过图电导估计每个用户-物品交互(用户-物品图中的一条边)的重要性,随后在网络上进行传播步骤以平滑估计的重要性值。由于我们提出的方法模型无关,我们可以结合模型无关与基于模型的子采样方法之长。经验上,我们表明将两者结合在所用数据集上持续优于任一单一方法。在 KuaiRec 和 MIND 数据集上的实验结果表明,我们提出的方法相比基线方法取得了更优结果。
引用
@article{arxiv.2305.16391,
title = {Graph-Based Model-Agnostic Data Subsampling for Recommendation Systems},
author = {Xiaohui Chen and Jiankai Sun and Taiqing Wang and Ruocheng Guo and Li-Ping Liu and Aonan Zhang},
journal= {arXiv preprint arXiv:2305.16391},
year = {2023}
}
备注
KDD 2023, fix typo