中文

推荐系统中的质量度量:我们是否一致地计算度量?

信息检索 2022-06-28 v1

摘要

离线评估是一种流行的方法,用于根据所选质量度量确定最佳算法。然而,如果所选度量计算了意料之外的内容,这种误传可能导致糟糕的决策和错误的结论。在本文中,我们深入调查用于推荐系统评估的质量度量。我们考察现代 RecSys 库中实现的实际方面以及学术论文中定义的理论方面。我们发现 Precision 是论文和库之间唯一被普遍理解的度量,而其他度量可能有不同的解释。不同库中实现的有时同名的度量却测量不同的事物,这导致在相同输入下给出不同结果。在学术论文中定义度量时,作者有时会省略明确的表述,或给出也不含解释的参考文献。在 47% 的情况下,我们无法轻易知道度量如何定义,因为定义不清晰或缺失。这些发现凸显了推荐系统评估中的又一困难,并呼吁对评估协议进行更详尽的描述。

关键词

引用

@article{arxiv.2206.12858,
  title  = {Quality Metrics in Recommender Systems: Do We Calculate Metrics Consistently?},
  author = {Yan-Martin Tamm and Rinchin Damdinov and Alexey Vasilev},
  journal= {arXiv preprint arXiv:2206.12858},
  year   = {2022}
}