关于 TasNet 用于低延迟单说话人语音增强
声音
2021-03-30 v1 音频与语音处理
摘要
近年来,主要得益于深度学习的复兴,语音处理算法取得了巨大进展。对于语音分离任务而言尤为如此,其中时域音频分离网络(TasNet)带来了显著改进。然而,对于同样具有重要性的相关任务——单说话人语音增强,尚不清楚 TasNet 架构是否同样成功。本文中,我们表明 TasNet 在语音增强上也改进了当前最优(SOTA)水平,且最大增益出现在诸如语音等调制噪声源上。此外,我们表明 TasNet 学习到了一种高效的内域表示,其中目标与噪声信号分量高度可分离。对于以干扰语音信号形式的噪声尤其如此,这或许解释了 TasNet 在分离任务上表现如此出色的原因。另外,我们表明 TasNet 在大帧跳时表现不佳,并推测混叠可能是导致该性能下降的主要原因。最后,我们表明 TasNet 持续优于一个最先进的单说话人语音增强系统。
引用
@article{arxiv.2103.14882,
title = {On TasNet for Low-Latency Single-Speaker Speech Enhancement},
author = {Morten Kolbæk and Zheng-Hua Tan and Søren Holdt Jensen and Jesper Jensen},
journal= {arXiv preprint arXiv:2103.14882},
year = {2021}
}