基于样本混合的数据增强用于家庭音频标注
声音
2018-08-14 v1 音频与语音处理
摘要
近十年来,音频标注受到越来越多的关注,并在许多领域具有各种潜在应用。音频标注的目标是预测音频片段的标签。最近,深度学习方法已被应用于音频标注并取得了最先进的性能,但在新数据上泛化能力较差。然而,由于音频标注数据(如 DCASE 数据)规模有限,训练得到的模型往往导致网络过拟合。以往的 pitch shifting、time stretching 和添加背景噪声等数据增强方法在音频标注中并未显示出明显改进。本文中,我们探索了用于家庭音频标注任务的样本混合数据增强,包括 mixup、SamplePairing 和 extrapolation。我们采用带注意力模块的卷积循环神经网络(CRNN)以对数尺度 mel 谱作为基线系统。在实验中,我们使用 mixup 方法在 DCASE 2016 task4 数据集上取得了等错误率(EER)0.10 的最先进结果,优于无数据增强的基线系统。
引用
@article{arxiv.1808.03883,
title = {Sample Mixed-Based Data Augmentation for Domestic Audio Tagging},
author = {Shengyun Wei and Kele Xu and Dezhi Wang and Feifan Liao and Huaimin Wang and Qiuqiang Kong},
journal= {arXiv preprint arXiv:1808.03883},
year = {2018}
}
备注
submitted to the workshop of Detection and Classification of Acoustic Scenes and Events 2018 (DCASE 2018), 19-20 November 2018, Surrey, UK