中文

嵌入式系统计算机视觉模型压缩技术综述

计算机视觉与模式识别 2024-08-16 v1

摘要

深度神经网络在大多数计算机视觉问题中一直代表最先进的水平。在这些场景中,更大更复杂的模型展现出优于较小架构的性能,尤其是在使用大量代表性数据进行训练的情况下。随着近期 Vision Transformer(ViT)架构和先进卷积神经网络(CNN)的采用,主干架构的总参数量从 2012 年 AlexNet 的 62M 增加到 2024 年 AIM-7B 的 7B。因此,在具有处理和运行时约束的环境中部署此类深度架构面临挑战,尤其是在嵌入式系统中。本文涵盖了应用于计算机视觉任务的主要模型压缩技术,使现代模型能够在嵌入式系统中使用。我们介绍了压缩子领域的特征,比较了不同方法,并讨论了在各种嵌入式设备上分析时如何选择最佳技术及预期变化。我们还分享了代码,以帮助研究人员和新从业者在每个子领域克服初始实现挑战,并展示了模型压缩的趋势。压缩模型的案例研究可在 \href{https://github.com/venturusbr/cv-model-compression}{https://github.com/venturusbr/cv-model-compression} 获取。

关键词

引用

@article{arxiv.2408.08250,
  title  = {Computer Vision Model Compression Techniques for Embedded Systems: A Survey},
  author = {Alexandre Lopes and Fernando Pereira dos Santos and Diulhio de Oliveira and Mauricio Schiezaro and Helio Pedrini},
  journal= {arXiv preprint arXiv:2408.08250},
  year   = {2024}
}