中文

加速边缘 AI:资源受限环境的优化

机器学习 2025-01-30 v2 人工智能 神经与进化计算

摘要

资源受限的边缘部署需要在计算、存储与能耗等严苛限制下实现高性能的人工智能解决方案。本综述全面概述了在此类约束下加速深度学习模型的主要策略。首先,我们审查了模型压缩技术——剪枝、量化、张量分解与知识蒸馏——这些技术将大规模模型简化为小型、快速且更高效的变体。随后,我们探讨了神经网络架构搜索(NAS),这是一类自动发现针对特定任务与硬件预算优化的体系结构的方法。我们还讨论了编译器与部署框架,如 TVM、TensorRT 与 OpenVINO,这些框架在推理阶段提供硬件量身定制的优化。通过将这三大支柱集成到统一的管道中,实践者可实现包括延迟降低、存储节省与能耗效率在内的多目标目标,同时保持具竞争力的准确率。我们还概述了层次化 NAS、神经符号方法以及针对大型语言模型的高级蒸馏等新兴前沿,突出了诸如大规模网络预训练剪枝等开放挑战。本综述提供了实用见解,确定了当前研究空白,并勾勒了构建面向边缘的可扩展、平台无关深度学习模型加速框架的前景方向。

关键词

引用

@article{arxiv.2501.15014,
  title  = {On Accelerating Edge AI: Optimizing Resource-Constrained Environments},
  author = {Jacob Sander and Achraf Cohen and Venkat R. Dasari and Brent Venable and Brian Jalaian},
  journal= {arXiv preprint arXiv:2501.15014},
  year   = {2025}
}

备注

26 pages, 13 Figures