AclNet:高效的端到端音频分类 CNN
声音
2018-11-19 v1 机器学习
机器学习
摘要
我们提出一种高效的端到端卷积神经网络架构 AclNet,用于音频分类。当使用我们的数据增强与正则化进行训练时,我们在 ESC-50 语料库上以 85.65% 的准确率取得了最先进的性能。我们的网络支持多种配置,使得内存与计算需求大幅降低,并给出了准确率与复杂度的权衡分析。该分析显示,与现有方案相比,在显著降低计算复杂度的同时实现了高准确率。例如,仅含 155k 参数和每秒 49.3 百万次乘加的配置达到了 81.75%,超过了 81.3% 的人类准确率。这种效率提升可使得在节能平台上的常开推理成为可能。
引用
@article{arxiv.1811.06669,
title = {AclNet: efficient end-to-end audio classification CNN},
author = {Jonathan J Huang and Juan Jose Alvarado Leanos},
journal= {arXiv preprint arXiv:1811.06669},
year = {2018}
}