DaisyRec 2.0:面向严谨评估的推荐系统基准测试
信息检索
2024-08-29 v1 机器学习
摘要
近来,推荐系统领域浮现出一个关键问题——缺乏用于严谨评估的有效基准——这进而导致评估不可复现、比较不公平。因此,我们从实用理论与实验的角度开展研究,旨在为严谨评估建立推荐基准。在理论研究方面,通过对2017—2020年间八大学术顶会发表的141篇论文进行详尽综述,系统总结并分析了贯穿整个评估链、影响推荐性能的一系列超因素。我们将它们归类为模型无关与模型相关的超因素,并据此定义和深入讨论了不同的严谨评估模式。在实验研究方面,我们发布了DaisyRec 2.0库,集成这些超因素以执行严谨评估,并借此开展整体实证研究,揭示不同超因素对推荐性能的影响。在理论与实验研究支撑下,我们最终通过提出标准化流程,并提供十个前沿方法在六个数据集上跨六个评估指标的性能作为后续研究参考,创建了严谨评估基准。总体而言,我们的工作揭示了推荐评估中的问题,为严谨评估提供了潜在解决方案,并为进一步研究奠定基础。
引用
@article{arxiv.2206.10848,
title = {DaisyRec 2.0: Benchmarking Recommendation for Rigorous Evaluation},
author = {Zhu Sun and Hui Fang and Jie Yang and Xinghua Qu and Hongyang Liu and Di Yu and Yew-Soon Ong and Jie Zhang},
journal= {arXiv preprint arXiv:2206.10848},
year = {2024}
}
备注
DaisyRec-v2.0 contains a Python toolkit developed for benchmarking top-N recommendation task. Our code is available at https://github.com/recsys-benchmark/DaisyRec-v2.0