探索设备推理边界:当 Tiny 不够时,层次化推理是解答之钥
机器学习
2025-04-18 v2 分布式、并行与集群计算
摘要
设备推理在边缘 ML 系统中具有能源效率、响应性和隐私性等潜在优势。然而,由于可嵌入资源受限设备的模型能力有限,使用场景受限于简单推理任务,如视觉关键词检测、手势识别和预测分析。在此背景下,层次化推理(Hierarchical Inference, HI)系统 emerged 作为一种有前景的解决方案,通过对特定样本卸载至边缘服务器或云端进行远程推理,提升本地 ML 能力。现有研究通过仿真证明 HI 可提升准确率,但未考虑设备端的延迟与能耗,也未涉及三大异构维度:硬件、网络连接与模型。本文基于对五种不同能力设备上嵌入式 ML 模型的测量,系统比较了 HI 与设备推理在准确率、延迟和能耗方面的性能。对于给定准确率要求,设计的 HI 系统比纯设备推理系统实现最高 73% 的延迟降低和 77% 的能耗降低。构建高效 HI 系统的关键在于具备小规模且相对准确的设备模型,其输出能有效区分需要远程推理的样本。尽管 HI 带来显著性能提升,但仍需为所有样本执行设备推理,这会增加固定的延迟和能耗开销。因此,我们设计了混合系统 Early Exit with HI(EE-HI),实验表明相较于 HI,EE-HI 可将延迟降低最高 59.7%,能耗降低最高 60.4%。
引用
@article{arxiv.2407.11061,
title = {Exploring the Boundaries of On-Device Inference: When Tiny Falls Short, Go Hierarchical},
author = {Adarsh Prasad Behera and Paulius Daubaris and Iñaki Bravo and José Gallego and Roberto Morabito and Joerg Widmer and Jaya Prakash Varma Champati},
journal= {arXiv preprint arXiv:2407.11061},
year = {2025}
}