中文

HI-Series算法:物质扩散算法与协同过滤的混合模型

信息检索 2025-03-04 v1

摘要

推荐系统面临在准确性和多样性之间进行权衡的挑战,因为传统协同过滤(CF)和基于网络的扩散算法具有互补的局限性。虽然基于物品的协同过滤(ItemCF)通过物品相似性提升多样性,但牺牲了准确性。相反,质量扩散(MD)算法优先考虑准确性,通过偏好热门物品但缺乏多样性。为解决这一权衡问题,我们提出HI-Series算法,这些混合模型将ItemCF与基于扩散的方法(MD、HHP、BHC、BD)进行非线性组合,通过参数ϵ\epsilon进行控制。这种混合方法利用ItemCF的多样性和MD的准确性,扩展至高级扩散模型(HI-HHP、HI-BHC、HI-BD)以获得更佳性能。在MovieLens、Netflix和RYM数据集上的实验表明,HI-Series算法显著优于其基线模型。在稀疏数据(20%训练)情况下,HI-MD相较于MD在F1分数上提升0.8%-4.4%,同时保持更高的多样性(MovieLens上Diversity@20: 459 vs. 396)。在稠密数据(80%训练)时,HI-BD相较于BD在F1分数上提升2.3%-5.2%,多样性提升最高达18.6%。值得注意的是,混合模型在稀疏设置中始终提升新颖性,并在参数适应性方面表现稳健。这些结果表明,战略性的混合方法有效打破准确性-多样性权衡,为在不同数据稀疏度水平上优化推荐系统提供了灵活框架。

关键词

引用

@article{arxiv.2503.01305,
  title  = {HI-Series Algorithms A Hybrid of Substance Diffusion Algorithm and Collaborative Filtering},
  author = {Yu Peng and Ya-Hui An},
  journal= {arXiv preprint arXiv:2503.01305},
  year   = {2025}
}