在端到端音频处理中利用领域知识
声音
2017-12-04 v1 音频与语音处理
机器学习
摘要
基于端到端神经网络的音频建模方法通常逊于在高级数据表示上训练的模型。本文展示的初步工作表明,训练深度卷积神经网络(CNN)模型的首层以学习常用的对数尺度梅尔谱变换是可行的。其次,我们证明在将端到端 CNN 分类器的首层用所学变换初始化后,其在 ESC-50 环境声音分类数据集上的收敛性与性能,与基于 CNN 且以高度预处理的对数尺度梅尔谱特征训练的模型相近。
引用
@article{arxiv.1712.00254,
title = {Utilizing Domain Knowledge in End-to-End Audio Processing},
author = {Tycho Max Sylvester Tax and Jose Luis Diez Antich and Hendrik Purwins and Lars Maaløe},
journal= {arXiv preprint arXiv:1712.00254},
year = {2017}
}
备注
Accepted at the ML4Audio workshop at the NIPS 2017