中文

何时使用集成方法?准确率-能耗权衡在推荐系统中的分析

信息检索 2026-04-10 v1 机器学习

摘要

集成方法在推荐系统中常用于通过组合多个模型来提高准确率。近期研究报告称可观的性能提升,但大多数研究仍主要优化准确率和鲁棒性,而非能源效率。本文衡量了相对于强大单模型的集成技术的准确率能耗权衡。我们在两个管道中进行 93 项受控实验:1. 使用 Surprise(RMSE)进行显式评分预测,2. 使用 LensKit(NDCG@10)进行隐式反馈排序。我们评估了范围从 10 万到 780 万互动的四个数据集(MovieLens 100K、MovieLens 1M、ModCloth、Anime)。我们比较了四种集成策略(平均、加权、堆叠或秩序融合、Top Performers)与基线和优化后的单模型。使用 EMERS 通过智能插座测量整个系统能耗,并转换为 CO2 当量。总体而言,集成方法在准确率提升 0.3% 到 5.7% 的同时,能耗增加 19% 到 2,549%。在 MovieLens 1M 上,Top Performers 集成相较于 SVD++ 提升 RMSE 0.96%,能耗增加 18.8%。在 MovieLens 100K 上,平均集成在 NDCG@10 提升 5.7%,额外能耗为 103%。在 Anime 数据集上,Surprise Top Performers 集成提升 RMSE 1.2%,但消耗 2,005% 额外能耗(0.21 vs. 0.01 Wh),导致排放从 2.6 增加到 53.8 mg CO2 当量,LensKit 集成因内存限制而失败。总体而言,选择性集成比彻底平均更具能源效率。

关键词

引用

@article{arxiv.2604.07869,
  title  = {Ensembles at Any Cost? Accuracy-Energy Trade-offs in Recommender Systems},
  author = {Jannik Nitschke and Lukas Wegmeth and Joeran Beel},
  journal= {arXiv preprint arXiv:2604.07869},
  year   = {2026}
}