推荐系统中数据异质性的探索与利用
信息检索
2023-05-26 v1 机器学习
摘要
海量数据是数据驱动推荐模型的基础。作为大数据的内在属性,数据异质性广泛存在于现实世界的推荐系统中。它反映了子群体之间属性的差异。忽略推荐数据中的异质性会限制推荐模型的性能、损害子群体鲁棒性,并使模型受到偏差的误导。然而,数据异质性在推荐领域尚未引起充分关注。因此,这启发我们充分探索并利用异质性,以解决上述问题并辅助数据分析。在本工作中,我们聚焦于探索推荐数据中两类具代表性的异质性,即预测机制异质性与协变量分布异质性,并提出一种通过双层聚类方法探索异质性的算法。此外,所揭示的异质性在推荐场景中被用于两个目的:基于多子模型的预测与辅助去偏。在真实数据上的大量实验验证了推荐数据中异质性的存在,以及探索并利用数据异质性的有效性。
引用
@article{arxiv.2305.15431,
title = {Exploring and Exploiting Data Heterogeneity in Recommendation},
author = {Zimu Wang and Jiashuo Liu and Hao Zou and Xingxuan Zhang and Yue He and Dongxu Liang and Peng Cui},
journal= {arXiv preprint arXiv:2305.15431},
year = {2023}
}
备注
14 pages, 14 figures