基于语音识别嵌入与解耦损失的无监督语音增强
音频与语音处理
2022-02-22 v2 声音
摘要
语音增强近年来在各种深度学习方法中取得了巨大成功。然而,大多数传统语音增强系统采用有监督方法训练,这带来了两个显著挑战。首先,多数语音增强系统的训练数据集是合成的。在混合干净语音与噪声语料库以创建合成数据集时,合成与真实世界噪声语音或音频录音之间存在域失配。其次,在提升语音增强性能与降低语音识别(ASR)性能之间存在权衡。因此,我们提出了一种无监督损失函数来解决这两个问题。我们的函数通过扩展MixIT损失函数并加入语音识别嵌入与解耦损失而构建。我们的结果表明,所提函数在噪声VoxCeleb数据集上相比有监督训练的基线有效提升了语音增强性能。尽管完全无监督训练无法超越相应基线,但在有监督与无监督联合训练下,系统能够取得与最佳有监督基线相似的语音质量以及更好的ASR性能。
引用
@article{arxiv.2111.08678,
title = {Unsupervised Speech Enhancement with speech recognition embedding and disentanglement losses},
author = {Viet Anh Trinh and Sebastian Braun},
journal= {arXiv preprint arXiv:2111.08678},
year = {2022}
}
备注
To appear in Proceeding of ICASSP 2022, May 2022