研究推荐系统中偏差的挑战:一项 UserKNN 案例研究
信息检索
2024-09-13 v1
摘要
关于推荐系统传播偏差的论断通常难以验证或证伪。偏差研究往往依赖于少量公开可用的数据集,因此受限于这些数据集的特定属性。此外,在研究中实现选择往往未被明确描述或说明动机,而它们可能对偏差传播产生影响。本文探讨了测量和报告流行度偏差的挑战。我们通过将合成数据与实现 UserKNN 的知名推荐系统框架相结合,展示了数据属性和算法配置对流行度偏差的影响。首先,基于 UserKNN 的功能,我们识别了可能影响流行度偏差的数据特征,并相应生成了结合这些特征的各种数据集。其次,我们定位了文献中不同实现间存在差异的 UserKNN 配置。我们评估了五个合成数据集和五种 UserKNN 配置下的流行度偏差,并提供了关于它们联合作用的见解。我们发现,根据数据特征的不同,各种 UserKNN 配置可能会得出关于流行度偏差传播的不同结论。这些结果表明,在报告和解释推荐系统中的偏差时,需要明确处理算法配置和数据属性。
引用
@article{arxiv.2409.08046,
title = {On the challenges of studying bias in Recommender Systems: A UserKNN case study},
author = {Savvina Daniil and Manel Slokom and Mirjam Cuper and Cynthia C. S. Liem and Jacco van Ossenbruggen and Laura Hollink},
journal= {arXiv preprint arXiv:2409.08046},
year = {2024}
}
备注
Accepted at FAccTRec@RecSys 2024, 11 pages