中文

面向深度声音识别的类别间样本学习

机器学习 2018-03-01 v2 声音 音频与语音处理 机器学习

摘要

深度学习方法在声音识别任务中已取得高性能。决定如何馈送训练数据对进一步提升性能十分重要。我们提出一种用于深度声音识别的新型学习方法:类别间学习(BC learning)。我们的策略是通过将类别间声音识别为类别间声音来学习判别性特征空间。我们以随机比例混合属于不同类别的两个声音来生成类别间声音。然后将混合声音输入模型并训练模型输出混合比例。BC 学习的优势不仅限于增加训练数据的多样性;BC 学习导致特征空间中 Fisher 准则的扩大以及各类别特征分布间位置关系的正则化。实验结果表明,BC 学习改善了各种声音识别网络、数据集和数据增强方案上的性能,其中 BC 学习被证明总是有益的。此外,我们构建了一个新的深度声音识别网络(EnvNet-v2)并用 BC 学习训练它。结果,我们取得了超越人类水平的性能。

关键词

引用

@article{arxiv.1711.10282,
  title  = {Learning from Between-class Examples for Deep Sound Recognition},
  author = {Yuji Tokozume and Yoshitaka Ushiku and Tatsuya Harada},
  journal= {arXiv preprint arXiv:1711.10282},
  year   = {2018}
}

备注

13 pages, 6 figures, published as a conference paper at ICLR 2018