扩散推荐模型与进步的错觉:关于可复现性与概念不匹配的令人担忧的研究
信息检索
2026-03-30 v3 机器学习
神经与进化计算
摘要
每年都有无数新的机器学习模型发表,据称在 top-n 推荐中显著推进了当前最优水平。然而,早期的可复现性研究表明,由于普遍的方法论问题(例如,与未调优的基线模型进行比较),该领域的进展可能非常有限,从而制造了进步的错觉。在这项工作中,我们通过尝试复现九种基于去噪扩散概率模型的 SIGIR 2023 和 2024 推荐算法,来检验这些问题在当今研究中是否依然存在,这是一个近期迅速扩展的研究领域。只有 25% 的报告结果完全可复现,并且由于原始论文依赖于弱基线,它们并未确立扩散模型相对于最先进方法的优越性。在我们的受控评估中,调优良好的简单基线持续超越了原始论文中报告的基于扩散模型的有效性。此外,我们发现了扩散模型的特征与传统 top-n 推荐任务特征之间的关键不匹配,对其在推荐中的适用性产生了怀疑。而且,在所分析的论文中,这些模型的生成能力被限制到了最低限度。总体而言,我们的结果呼吁在该领域的研究和发表文化中加强科学严谨性并进行颠覆性变革。
引用
@article{arxiv.2505.09364,
title = {Diffusion Recommender Models and the Illusion of Progress: A Concerning Study of Reproducibility and a Conceptual Mismatch},
author = {Michael Benigni and Maurizio Ferrari Dacrema and Dietmar Jannach},
journal= {arXiv preprint arXiv:2505.09364},
year = {2026}
}