中文

用于基于神经网络的实时语音增强的加权语音失真损失

音频与语音处理 2020-02-14 v2 声音

摘要

本文研究了训练循环神经网络(RNN)的若干方面,这些方面影响用于实时单通道语音增强的增强语音的客观与主观质量。具体而言,我们关注一种以单帧输入、单帧输出方式增强短时语音谱的 RNN,这是大多数经典信号处理方法所采用的框架。我们提出了两种基于均方误差的新型学习目标,能够分别控制语音失真与噪声抑制的重要性。所提出的损失函数通过广泛接受的客观质量与可懂度度量进行评估,并与其他有竞争力的在线方法进行比较。此外,我们研究了特征归一化与变化的批序列长度对增强语音客观质量的影响。最后,我们给出了所提方法与一种最先进的实时 RNN 基方法的主观评分。

关键词

引用

@article{arxiv.2001.10601,
  title  = {Weighted Speech Distortion Losses for Neural-network-based Real-time Speech Enhancement},
  author = {Yangyang Xia and Sebastian Braun and Chandan K. A. Reddy and Harishchandra Dubey and Ross Cutler and Ivan Tashev},
  journal= {arXiv preprint arXiv:2001.10601},
  year   = {2020}
}