由多分辨率频率编码器与解码器辅助的时域语音增强
声音
2023-03-28 v1 音频与语音处理
摘要
时域语音增强(SE)近来被深入探究。在近期工作中,DEMUCS 引入多分辨率 STFT 损失以提升性能。然而,用于 STFT 的某些分辨率包含非平稳信号,且仅以单一输出同时学习多分辨率频率损失具有挑战性。为了更好地利用多分辨率频率信息,我们将不同帧长的多个谱图补充进时域编码器。它们在窄带和宽带中提取平稳频率信息。我们还采用多个解码器输出,每个输出计算其对应分辨率的频率损失。实验结果表明:(1)在编码器中融合平稳频率特征比非平稳特征更有效;(2)与频率损失一致的多输出提升了性能。在 Voice-Bank 数据集上的实验显示,所提方法获得了 0.14 PESQ 的提升。
引用
@article{arxiv.2303.14593,
title = {Time-domain Speech Enhancement Assisted by Multi-resolution Frequency Encoder and Decoder},
author = {Hao Shi and Masato Mimura and Longbiao Wang and Jianwu Dang and Tatsuya Kawahara},
journal= {arXiv preprint arXiv:2303.14593},
year = {2023}
}