中文

衡量推荐系统的稳定性与可塑性

信息检索 2026-05-15 v4 机器学习

摘要

评估推荐算法的典型离线协议是收集用户-项目交互数据集,然后使用其中一部分数据训练模型,剩余数据用于衡量模型推荐与观察到的用户交互之间的匹配程度。这一协议简单、有用且实用,但仅提供快照性能。我们知道,线上系统是随时间演化的。通常,模型需要定期使用最新数据重新训练。但如果是这样,前一次评估能否信赖?当不同模式(重新)出现时,模型会表现如何?本文提出了一种方法来研究推荐模型在重新训练时的行为。该方法的思想是根据算法在一方面保持过去模式——稳定性——以及另一方面(快速)适应变化——可塑性方面的能力进行轮廓化。我们设计了一种提供模型长期行为细节的离线评估协议,该协议对数据集、算法和指标均不敏感。为说明该框架的潜力,我们在 GoodReads 数据集上对三种不同类型的算法进行初步测试,结果表明不同算法技术会导致不同的稳定性和可塑性轮廓,以及稳定性与可塑性之间的可能权衡。我们进一步讨论了该提议的潜力与局限性,并提出一些可能的改进。

关键词

引用

@article{arxiv.2508.03941,
  title  = {Measuring the stability and plasticity of recommender systems},
  author = {Maria João Lavoura and Robert Jungnickel and João Vinagre},
  journal= {arXiv preprint arXiv:2508.03941},
  year   = {2026}
}

备注

Final version published in the proceedings of ACM UMAP 2026: https://doi.org/10.1145/3774935.3812707