更多更好?在集成学习系统中导航准确率与能源效率设计之间的权衡
机器学习
2024-07-04 v1 软件工程
摘要
背景:机器学习模型组合是缓解单一模型短板并设计更有效 ML 启用系统的流行技术。虽然集成学习,即将同一请求转发给多个模型并融合其预测,已广泛用于准确性,但我们对如何设计能源效率集成缺乏足够知识。目标:因此,我们分析了关于准确率与能源消耗之间潜在权衡的三种集成学习设计决策: a)集成大小,即集成中模型的数量;b)融合方法(多数投票 vs. meta-model),c)分区方法(whole-dataset vs. subset-based training)。方法:通过将四种流行分类 ML 算法组合成不同集成,我们进行了完整的因子实验,包含 11 个集成 × 4 个数据集 × 2 个融合方法 × 2 个分区方法(共 176 种组合)。对于每种组合,我们测量了准确率(F1-score)和能源消耗(J,包括训练和推理)。结果:虽然更大的集成大小显著增加了能源消耗(规模为 2 的集成消耗的能源小于规模为 3 的集成,后者又小于规模为 4 的集成),但未显著提高准确率。此外,多数投票在准确率(Cohen's d 为 0.38)和能源消耗(Cohen's d 为 0.92)方面均优于 meta-model 融合。最后,基于子集的训练显著降低了能源消耗(Cohen's d 为 0.91),而对 entire dataset 的训练未显著提高准确率。结论:从绿色 AI 的角度看,我们建议设计规模较小的集成(2 或最多 3 个模型),使用基于子集的训练,采用多数投票,以及使用决策树、朴素贝叶斯或 KNN 等能源效率 ML 算法。
引用
@article{arxiv.2407.02914,
title = {The More the Merrier? Navigating Accuracy vs. Energy Efficiency Design Trade-Offs in Ensemble Learning Systems},
author = {Rafiullah Omar and Justus Bogner and Henry Muccini and Patricia Lago and Silverio Martínez-Fernández and Xavier Franch},
journal= {arXiv preprint arXiv:2407.02914},
year = {2024}
}
备注
Currently under review at a journal