探究自监督学习在语音增强与分离中的应用
音频与语音处理
2022-03-16 v1
摘要
语音增强与分离是鲁棒语音处理的两项基本任务。语音增强抑制背景噪声,而语音分离从干扰说话人中提取目标语音。尽管已提出大量基于监督学习的增强与分离方法并取得了良好性能,但关于将自监督学习(SSL)应用于增强与分离的研究仍然有限。在本文中,我们在语音增强和分离下游任务上评估了 13 种 SSL 上游方法。我们在 Voicebank-DEMAND 和 Libri2Mix 上的实验结果表明,某些 SSL 表征持续优于包括短时傅里叶变换(STFT)幅度和对数梅尔滤波器组(FBANK)在内的基线特征。此外,我们分析了使现有 SSL 框架难以应用于语音增强与分离的因素,并讨论了两项任务所需的表征特性。我们的研究作为 SUPERB 的官方语音增强与分离下游任务被纳入。
引用
@article{arxiv.2203.07960,
title = {Investigating self-supervised learning for speech enhancement and separation},
author = {Zili Huang and Shinji Watanabe and Shu-wen Yang and Paola Garcia and Sanjeev Khudanpur},
journal= {arXiv preprint arXiv:2203.07960},
year = {2022}
}
备注
To appear in ICASSP 2022