基于感知损失的语音去噪及音频模式识别与自监督模型集成
音频与语音处理
2020-10-23 v1 声音
摘要
基于深度学习的语音去噪仍面临提升增强信号感知质量的挑战。我们引入了一个基于感知损失思想构建的通用框架,称为感知集成正则化损失(PERL)。感知损失抑制对某些语音属性的失真,我们使用六个大规模预训练模型对其进行分析:说话人分类、声学模型、说话人嵌入、情感分类,以及两个自监督语音编码器(PASE+、wav2vec 2.0)。我们首先在名为 VCTK-DEMAND 的流行增强基准上利用 Conformer Transformer 网络构建了一个强基线(无 PERL)。逐一使用辅助模型时,我们发现声学事件和自监督模型 PASE+ 最为有效。我们的最佳模型(PERL-AE)仅使用声学事件模型(利用 AudioSet)在主要感知指标上优于最先进的方法。为探索去噪能否利用完整框架,我们使用所有网络但发现我们的七损失公式受制于多任务学习的挑战。最后,我们报告一个关键观察:最先进的多任务权重学习方法无法超越手工调参,或许由于领域不匹配和损失弱互补性的挑战。
引用
@article{arxiv.2010.11860,
title = {Perceptual Loss based Speech Denoising with an ensemble of Audio Pattern Recognition and Self-Supervised Models},
author = {Saurabh Kataria and Jesús Villalba and Najim Dehak},
journal= {arXiv preprint arXiv:2010.11860},
year = {2020}
}