中文

SpecAugment++:一种用于声学场景分类的隐空间数据增强方法

音频与语音处理 2021-06-16 v3 声音

摘要

本文提出SpecAugment++,一种基于深度神经网络、用于声学场景分类(ASC)的新颖数据增强方法。不同于SpecAugment和mixup等其他仅作用于输入空间的流行数据增强方法,SpecAugment++同时应用于深度神经网络的输入空间与隐空间,以增强输入与中间特征表示。对于中间隐状态,增强技术包括掩蔽频率通道块与掩蔽时间帧块,其通过使模型不仅关注最具判别力的特征部分、也关注整体部分来提升泛化能力。除使用零值进行掩蔽外,我们还考察了两种基于小批量内其他样本使用的掩蔽方法,有助于向网络引入噪声使其对分类更具判别力。在DCASE 2018 Task1数据集与DCASE 2019 Task1数据集上的实验结果表明,我们所提方法相较无增强的强基线(即CP-ResNet)分别获得3.6%与4.7%的准确率提升,并优于其他先前的数据增强方法。

关键词

引用

@article{arxiv.2103.16858,
  title  = {SpecAugment++: A Hidden Space Data Augmentation Method for Acoustic Scene Classification},
  author = {Helin Wang and Yuexian Zou and Wenwu Wang},
  journal= {arXiv preprint arXiv:2103.16858},
  year   = {2021}
}

备注

Submitted to Interspeech 2021