中文

无监督学习神经音频特征

声音 2022-03-30 v1 机器学习 音频与语音处理

摘要

深度音频分类传统上被视作在 mel 滤波器组之上以有监督方式训练深度神经网络,近来受益于两条独立的研究脉络。其一是探索“可学习前端”,即产生可学习时间-频率表示的神经模块,以克服固定特征的局限。其二是使用自监督学习来利用前所未有的预训练数据规模。在本工作中,我们研究将两种方法结合的可行性,即针对下游分类任务与主体架构联合预训练可学习前端。首先,我们表明在 Audioset 上预训练两种先前提出的前端(SincNet 与 LEAF)相较固定 mel 滤波器组大幅提升了线性探测性能,意味着可学习时间-频率表示比有监督训练更能惠及自监督预训练。令人惊讶的是,在自监督设定下随机初始化的可学习滤波器组优于 mel 尺度初始化,这一反直觉结果质疑了在设计可学习滤波器时采用强先验的恰当性。通过对所学前端组件的探索性分析,我们揭示了这些前端在有监督与自监督设定下性质的关键差异,尤其是自监督滤波器显著偏离 mel 尺度以建模更宽频率范围的倾向。

关键词

引用

@article{arxiv.2203.15519,
  title  = {Learning neural audio features without supervision},
  author = {Sarthak Yadav and Neil Zeghidour},
  journal= {arXiv preprint arXiv:2203.15519},
  year   = {2022}
}

备注

Submitted to Interspeech 2022