中文

训练数据集大小对判别式和基于扩散的语音增强系统的影响

音频与语音处理 2024-09-10 v2

摘要

基于深度神经网络的语音增强系统的性能通常随训练数据集大小的增加而提升。然而,研究训练数据集大小对语音增强性能影响的先前工作并未考虑最新的方法,例如基于扩散的生成模型。扩散模型通常使用海量数据集进行图像生成任务的训练,但语音增强是否也需要如此尚不清楚。此外,研究训练数据集大小影响的先前工作并未控制数据多样性。因此,性能提升是由于数据集大小增加还是多样性增加尚不明确。因此,我们在匹配条件下系统性地研究了训练数据集大小对几种流行的最先进判别式和基于扩散的语音增强系统性能的影响。我们通过使用一组固定的语音话语、噪声片段和双耳房间脉冲响应来生成不同大小的数据集,从而控制数据多样性。我们发现,在使用10小时或更少的数据集时,基于扩散的系统在客观指标上相对于判别式系统表现最佳。然而,当增加训练数据集大小时,其客观指标性能的提升不如判别式系统,并且在数据集达到100小时或更多时,其性能被判别式系统超越。

关键词

引用

@article{arxiv.2406.06160,
  title  = {The Effect of Training Dataset Size on Discriminative and Diffusion-Based Speech Enhancement Systems},
  author = {Philippe Gonzalez and Zheng-Hua Tan and Jan Østergaard and Jesper Jensen and Tommy Sonne Alstrøm and Tobias May},
  journal= {arXiv preprint arXiv:2406.06160},
  year   = {2024}
}

备注

Accepted version