通过 Inception Nucleus 的端到端听觉对象识别
声音
2020-05-26 v1 机器学习
音频与语音处理
机器学习
摘要
听觉对象识别的机器学习方法传统上基于工程化特征,例如由频谱或倒谱导出的那些。近来,图像与听觉识别系统中的端到端分类系统被开发出来,以联合学习特征与分类,并带来分类准确率的提升。本文提出一种新颖的端到端深度神经网络,将原始波形输入映射到声音类别标签。我们的网络包含一个“inception nucleus”,其动态优化卷积滤波器的大小,从而大幅减少工程投入。分类结果优于当前最先进的方法,在 Urbansound8k 数据集上超出其 10.4 个百分点。对所学表征的分析揭示,较早隐藏层中的滤波器学习了类小波变换以提取对分类具信息性的特征。
引用
@article{arxiv.2005.12195,
title = {End-to-End Auditory Object Recognition via Inception Nucleus},
author = {Mohammad K. Ebrahimpour and Timothy Shea and Andreea Danielescu and David C. Noelle and Christopher T. Kello},
journal= {arXiv preprint arXiv:2005.12195},
year = {2020}
}
备注
Published In proceedings of ICASSP 2020