边缘端环境声分类:面向极致资源受限设备的深度声学网络流水线
声音
2022-09-21 v4 计算机视觉与模式识别
机器学习
音频与语音处理
摘要
人们正投入大量努力,将最先进的分类与识别能力引入具有极端资源约束(内存、速度及缺乏GPU支持)的边缘设备。在此,我们展示了首个用于声学识别的深度网络,它小巧、灵活且利于压缩,同时在原始音频分类上达到了最先进的性能。我们并未手工打造一次性解决方案,而是提出了一条通用流水线,通过压缩与量化将大型深度卷积网络自动转换为面向资源匮乏边缘设备的网络。在介绍ACDNet(其在ESC-10上达到96.65%、ESC-50上87.10%、UrbanSound8K上84.45%和AudioEvent上92.57%的 above SOTA精度)之后,我们描述了压缩流水线,并表明它使我们在这些数据集上实现了97.22%的尺寸缩减与97.28%的FLOP缩减,同时保持接近最先进的精度:96.25%、83.65%、78.27%和89.69%。我们描述了在标准现成微控制器上的成功实现,并在实验室基准之外报告了在真实世界数据集上的成功测试。
引用
@article{arxiv.2103.03483,
title = {Environmental Sound Classification on the Edge: A Pipeline for Deep Acoustic Networks on Extremely Resource-Constrained Devices},
author = {Md Mohaimenuzzaman and Christoph Bergmeir and Ian Thomas West and Bernd Meyer},
journal= {arXiv preprint arXiv:2103.03483},
year = {2022}
}