中文

在有限数据集上改进机器听觉

声音 2025-02-20 v3 机器学习 音频与语音处理 信号处理 机器学习

摘要

卷积神经网络(CNN)架构起源于图像机器学习并使其发生革命性变化。为在音频数据的预测建模中利用CNN,常应用基于FFT的标准信号处理方法来将原始音频波形转换为类图像表示(如频谱图)。尽管传统图像与频谱图在特征属性上不同,此类预处理减少了成功训练所需的训练数据量。本文中,我们在音乐信息检索场景下研究输入与目标表示如何与可用训练数据量相互作用。我们将标准梅尔频谱图输入与新提出的称为梅尔散射(Mel scattering)的表示进行比较。此外,我们通过使用融入未利用可用信息的增广目标损失函数,研究额外目标数据表示的影响。我们观察到,在使用有限数据集时,所有提出的方法均优于标准梅尔变换表示,并讨论了它们的优势与局限。为可复现实验,源代码及中间结果与模型检查点均在在线仓库中提供。

关键词

引用

@article{arxiv.1903.08950,
  title  = {Improving Machine Hearing on Limited Data Sets},
  author = {Pavol Harar and Roswitha Bammer and Anna Breger and Monika Dörfler and Zdenek Smekal},
  journal= {arXiv preprint arXiv:1903.08950},
  year   = {2025}
}

备注

13 pages, 3 figures, 2 tables. Repository for reproducibility: https://gitlab.com/hararticles/gs-ms-mt/. Keywords: audio, CNN, limited data, Mel scattering, mel-spectrogram, augmented target loss function. Rewritten and restructured after peer revision. Recomputed and added new experiments and visualizations. Changed the presentation of the results