中文

探索基于时序卷积网络的DNN低延迟语音增强最佳损失函数

音频与语音处理 2020-08-21 v3 声音

摘要

近年来,深度神经网络(DNN)已成功用于语音增强,基于DNN的语音增强正成为一个颇具吸引力的研究领域。过去几年,基于短时傅里叶变换(STFT)的时频掩蔽虽被广泛用于基于DNN的语音增强,但时域方法,如时域音频分离网络(TasNet),也已被提出。最合适的方法取决于数据集的规模和任务类型。本文中,我们在两个不同数据集上探索最佳语音增强算法。我们提出了一种基于STFT的方法,以及一种利用问题无关语音编码器(PASE)特征来提升较小数据集主观质量的损失函数。我们提出的方法在Voice Bank + DEMAND数据集上有效,且与其他当前最优方法相比表现良好。我们还实现了一个低延迟版本的TasNet,已提交至DNS挑战赛并通过开源方式公开。我们的模型在DNS挑战赛数据集上取得了优异性能。

关键词

引用

@article{arxiv.2005.11611,
  title  = {Exploring the Best Loss Function for DNN-Based Low-latency Speech Enhancement with Temporal Convolutional Networks},
  author = {Yuichiro Koyama and Tyler Vuong and Stefan Uhlich and Bhiksha Raj},
  journal= {arXiv preprint arXiv:2005.11611},
  year   = {2020}
}