推荐系统的最优数据集大小:通过下采样评估算法性能
信息检索
2025-02-17 v2
摘要
本论文探讨数据集下采样作为优化推荐系统能源效率策略的可行性,同时保持具竞争力的性能。随着数据集规模不断增大,带来计算和环境挑战,本研究探索了能源效率与推荐质量之间的权衡,尤其针对旨在减少环境影响的绿色推荐系统。通过对七个数据集、12个算法和两种核心剪枝水平应用两种下采样方法,研究表明可显著降低运行时间和碳排放。例如,30%的下采样比例可使运行时间比完整数据集降低52%,在单个算法训练单个数据集期间,碳排放减少最高可达51.02 KgCO2e。分析显示,算法在不同下采样比例下的性能取决于因素如数据集特征、算法复杂度以及特定的下采样配置(情景依赖)。一些算法相对于表现更好的算法,其nDCG@10分数较低,但对训练数据的敏感度较低,在较低的下采样比例中具有更大的效率潜力。平均而言,这些算法仅使用50%的训练集即可保留81%的完整规模性能。在某些下采样配置中,其中更多用户被逐步包含而测试集规模固定,这些算法甚至在使用完整数据集时也表现出更高的nDCG@10分数。这些发现凸显了在可持续性和有效性之间取得平衡的可行性,为设计能源效率的推荐系统并促进可持续AI实践提供了见解。
引用
@article{arxiv.2502.08845,
title = {Optimal Dataset Size for Recommender Systems: Evaluating Algorithms' Performance via Downsampling},
author = {Ardalan Arabzadeh},
journal= {arXiv preprint arXiv:2502.08845},
year = {2025}
}