自适应分辨率推断(ARI):面向物联网的能效机器学习
机器学习
2024-08-28 v1 分布式、并行与集群计算
摘要
在物联网设备上实现机器学习面临显著的运营挑战,由于能源和计算资源有限。近年来,大量努力致力于实现可以在降低计算和能耗的同时保持合理性能的简化 ML 模型,例如通过修剪神经网络的权重或使用参数和算术运算的 reduced precision。然而,这种方法受限于 ML 实现的性能,即因模型简化而产生的性能损失。本文提出了自适应分辨率推断(ARI)方法,以 enable 在能量耗散和模型性能之间建立新的权衡。该方法的主要原理是使用 reduced precision(量化)进行推断,并利用决策阈值的 margin 来确定结果是否可靠,或者推断是否必须使用完整模型。该方法的 rationale 是量化仅引入推断得分的小幅偏差,因此如果得分在决策阈值之上具有足够的 margin,则完整模型可能会以不同结果。因此,我们可以首先运行量化模型,只有当得分不具备足够的 margin 时,才运行完整模型。这使得大多数推断都使用 reduced precision 模型运行,只有少数需要完整模型,从而在不影响模型性能的前提下显著降低计算和能耗。本文详细介绍了 ARI 方法,进行了分析,并使用不同数据集评估了浮点和随机计算实现。结果表明,ARI 在不同配置下可显著降低能耗,节省比例在 40% 到 85% 之间。
引用
@article{arxiv.2408.14528,
title = {Adaptive Resolution Inference (ARI): Energy-Efficient Machine Learning for Internet of Things},
author = {Ziheng Wang and Pedro Reviriego and Farzad Niknia and Javier Conde and Shanshan Liu and Fabrizio Lombardi},
journal= {arXiv preprint arXiv:2408.14528},
year = {2024}
}