中文

关于训练神经网络语音分离模型的数据采样策略

声音 2023-06-19 v2 人工智能 机器学习 神经与进化计算 音频与语音处理

摘要

语音分离仍是多说话人信号处理的重要领域。深度神经网络(DNN)模型已在许多语音分离基准上取得最佳性能。其中部分模型的训练耗时显著且内存需求高。已有工作提出缩短训练样本以应对这些问题,但其对模型性能的影响尚不明了。本工作中,我们分析了对两种语音分离模型应用这些训练信号长度(TSL)限制的影响:SepFormer(一种transformer模型)与Conv-TasNet(一种卷积模型)。我们从信号长度分布及其对训练效率的影响角度分析了WSJ0-2Mix、WHAMR和Libri2Mix数据集。结果表明,对于特定分布,应用特定TSL限制可带来更优性能。这主要归因于随机采样波形的起始索引,从而产生了更多独特的训练样本。一个使用4.42s的TSL限制与动态混合(DM)训练的SepFormer模型,被证明可与使用DM及无限信号长度训练的最佳SepFormer模型相媲美。此外,4.42s的TSL限制在WHAMR上使训练时间减少44%。

关键词

引用

@article{arxiv.2304.07142,
  title  = {On Data Sampling Strategies for Training Neural Network Speech Separation Models},
  author = {William Ravenscroft and Stefan Goetze and Thomas Hain},
  journal= {arXiv preprint arXiv:2304.07142},
  year   = {2023}
}

备注

Accepted for EUSIPCO 2023