降低基于 DNN 的大规模音频分类模型复杂度
声音
2018-10-31 v2 音频与语音处理
摘要
音频分类是识别与给定音频信号相关联的声音类别的任务。本文基于近期发布的 AudioSet 数据库,对大规模音频分类进行了研究。AudioSet 包含来自 YouTube 的 200 万条音频样本,由人工标注了 527 个声音类别标签。利用 AudioSet 的平衡训练集与评估集,应用不同类型的神经网络模型进行了音频分类实验。对这些模型的分类性能与模型复杂度进行了比较与分析。虽然 CNN 模型表现出优于 MLP 和 RNN 的性能,但其模型复杂度相对较高,不利于实际使用。我们提出两种不同的策略,旨在构建低维嵌入特征提取器,从而减少模型参数数量。结果表明,简化 CNN 模型的模型参数仅为原模型的 1/22,且性能仅有轻微下降。
引用
@article{arxiv.1711.00229,
title = {Reducing Model Complexity for DNN Based Large-Scale Audio Classification},
author = {Yuzhong Wu and Tan Lee},
journal= {arXiv preprint arXiv:1711.00229},
year = {2018}
}
备注
Accepted by ICASSP 2018