中文

SpecMix:一种用于时频域特征训练的混合样本数据增强方法

声音 2021-08-09 v1

摘要

我们提出了一种混合样本数据增强策略,以提升模型在音频场景分类、声音事件分类和语音增强任务上的性能。尽管已有若干增强方法被证明能有效改善图像分类性能,但它们对音频时频域特征的有效性尚不确定。我们提出了一种专为处理时频域特征而设计的新型音频数据增强方法“Specmix”。该增强方法通过对两个不同数据样本施加能有效保持各音频样本谱相关性的时频掩码来进行混合。我们在音频场景分类、声音事件分类和语音增强任务上的实验表明,所提出的 Specmix 最多可将多种神经网络架构的性能提升 2.7%。

关键词

引用

@article{arxiv.2108.03020,
  title  = {SpecMix : A Mixed Sample Data Augmentation method for Training withTime-Frequency Domain Features},
  author = {Gwantae Kim and David K. Han and Hanseok Ko},
  journal= {arXiv preprint arXiv:2108.03020},
  year   = {2021}
}

备注

Accepted to interspeech 2021