中文

利用重叠帧预测改进帧在线神经语音增强

声音 2022-07-13 v2 音频与语音处理

摘要

短时傅里叶变换(STFT)域中的帧在线语音增强系统通常由于逆 STFT(iSTFT)中使用重叠相加而具有等于窗长的算法延迟。该算法延迟使增强模型能够利用长达窗长长度的未来上下文信息。然而,当前的帧在线系统仅部分利用了该信息。为充分利用之,我们提出一种用于基于深度学习的帧在线语音增强的重叠帧预测技术,其中在每一帧我们的深度神经网络(DNN)预测当前及重叠相加所需的若干过去帧,而非仅预测当前帧。此外,我们提出一种损失函数以考虑预测信号与理想目标信号之间的尺度差异。在噪声-混响语音增强任务上的实验显示了所提算法的有效性。

关键词

引用

@article{arxiv.2204.07566,
  title  = {Improving Frame-Online Neural Speech Enhancement with Overlapped-Frame Prediction},
  author = {Zhong-Qiu Wang and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2204.07566},
  year   = {2022}
}

备注

in IEEE Signal Processing Letters