中文

nnAudio:基于一维卷积神经网络的即时 GPU 音频至频谱图转换工具箱

声音 2020-08-25 v3 机器学习 音频与语音处理

摘要

将时域波形转换为频域频谱图通常被视为模型训练前的一项预处理步骤。然而,这种方法存在若干缺点。首先,存储不同的频域表示需要大量硬盘空间,在模型开发与调参过程中探索各类频谱图以求得最优性能时尤为如此。其次,若使用另一数据集,必须重新处理所有音频片段,网络才能重新训练。本文中,我们将时域到频域的转换集成作为模型结构的一部分,并提出基于神经网络的工具箱 nnAudio,其利用一维卷积神经网络在前馈过程中完成时域到频域的转换。它支持即时频谱图生成,无需在磁盘上存储任何频谱图。该方法还允许对波形到频谱图转换层进行反向传播,意味着该转换过程可训练,从而可通过梯度下降进一步优化。nnAudio 将 1,770 个波形(来自 MAPS 数据集)的波形到频谱图转换时间,从 librosa 的 10.6410.64 秒缩短至仅 0.0010.001 秒(短时傅里叶变换,STFT),从 18.318.3 秒降至 0.0150.015 秒(梅尔频谱图),从 103.4103.4 秒降至 0.2580.258 秒(常数 Q 变换,CQT),以上均在我们 DGX 工作站上使用 GPU 测得(CPU:Intel(R) Xeon(R) CPU E5-2698 v4 @ 2.20GHz,Tesla v100 32Gb GPUs;所有实验仅使用 1 块 GPU)。我们还进一步优化了现有 CQT 算法,使 CQT 频谱图在无混叠的情况下以快得多的计算时间获得(从 0.2580.258 秒降至仅 0.0010.001 秒)。

关键词

引用

@article{arxiv.1912.12055,
  title  = {nnAudio: An on-the-fly GPU Audio to Spectrogram Conversion Toolbox Using 1D Convolution Neural Networks},
  author = {Kin Wai Cheuk and Hans Anderson and Kat Agres and Dorien Herremans},
  journal= {arXiv preprint arXiv:1912.12055},
  year   = {2020}
}

备注

Accepted In IEEE Access