剪枝 vs XNOR-Net:面向边缘设备音频分类的深度学习方法综合研究
声音
2022-01-19 v3 计算机视觉与模式识别
摘要
深度学习在计算机视觉和机器听觉等物联网(IoT)诸多相关应用领域取得了巨大成功。这些技术最终必须直接部署到边缘端,以充分释放深度学习在 IoT 中的潜力。显而易见的挑战是,只有当模型被大幅压缩时,深度学习技术才能在严格资源受限的边缘设备上实现。该任务依赖于不同的模型压缩技术,例如网络剪枝、量化以及近期的 XNOR-Net 进展。本研究考察了这些技术对于微控制器上音频分类的适用性。我们提出了一种用于端到端原始音频分类的 XNOR-Net 应用,并开展了一项将该方法与剪枝-量化方法进行比较的综合实证研究。我们表明,对于较少类别数,使用 XNOR 的原始音频分类可达到与常规全精度网络相当的性能,同时将内存需求降低 32 倍、计算需求降低 58 倍。然而,随着类别数显著增加,性能下降,基于剪枝-量化的压缩技术成为首选,其能够在满足相同空间约束的同时需要约 8 倍更多的计算量。我们表明,这些发现在使用标准基准集的原始音频分类与图像分类之间是一致的。据我们所知,这是首个将 XNOR 应用于端到端音频分类并在替代技术背景下对其进行评估的研究。所有代码已在 GitHub 上公开。
引用
@article{arxiv.2108.06128,
title = {Pruning vs XNOR-Net: A Comprehensive Study of Deep Learning for Audio Classification on Edge-devices},
author = {Md Mohaimenuzzaman and Christoph Bergmeir and Bernd Meyer},
journal= {arXiv preprint arXiv:2108.06128},
year = {2022}
}
备注
13 pages