中文

基于原始波形与混合训练策略的端到端音频分类系统

音频与语音处理 2019-11-22 v1 计算机视觉与模式识别 机器学习 多媒体

摘要

音频分类能够区分不同种类的声音,有助于日常生活中的智能应用。然而,由于一段音频片段中的声音事件可能是多个甚至重叠的,这仍是一项具有挑战性的任务。本文介绍了一种基于原始波形与混合训练策略的端到端音频分类系统。与现有研究中广泛使用的人工设计特征相比,原始波形包含更完整的信息,更适用于多标签分类。以原始波形作为输入,我们的网络由两种 ResNet 结构的变体组成,能够学习具有判别性的表示。为探索中间层中的信息,我们的模型采用了带注意力结构的多级预测。此外,我们设计了一种混合训练策略,以打破训练数据量带来的性能限制。实验表明,所提出的音频分类系统在 Audio Set 数据集上的平均精度均值(mean average precision)为 37.2%。在不使用额外训练数据的情况下,我们的系统超越了当前最优(state-of-the-art)的多级注意力模型。

关键词

引用

@article{arxiv.1911.09349,
  title  = {An End-to-End Audio Classification System based on Raw Waveforms and Mix-Training Strategy},
  author = {Jiaxu Chen and Jing Hao and Kai Chen and Di Xie and Shicai Yang and Shiliang Pu},
  journal= {arXiv preprint arXiv:1911.09349},
  year   = {2019}
}

备注

InterSpeech 2019