DENT-DDSP:基于可微数字信号处理器实现显式失真建模与噪声鲁棒语音识别的数据高效噪声语音生成器
音频与语音处理
2022-08-02 v1 声音
摘要
自动语音识别(ASR)系统在噪声条件下的性能会急剧下降。显式失真建模(EDM)作为一种特征补偿步骤,能够通过从干净语音模拟出域内噪声语音来增强此类条件下的 ASR 系统。然而,现有的失真模型要么不可训练,要么不可解释,且往往缺乏可控性与泛化能力。本文提出一种完全可解释且可控的模型:DENT-DDSP 来实现 EDM。DENT-DDSP 利用新颖的可微数字信号处理(DDSP)组件,仅需 10 秒训练数据即可实现高保真度。实验表明,就多尺度谱损失(MSSL)而言,DENT-DDSP 模拟的噪声数据相较于其他基线模型取得了最高的模拟保真度。此外,为验证 DENT-DDSP 模拟的数据能否替代噪声鲁棒 ASR 任务中稀缺的域内噪声数据,我们使用模拟数据与真实数据分别训练了若干具有相同架构的下游 ASR 模型。实验表明,使用 DENT-DDSP 模拟噪声数据训练的模型在词错误率(WER)方面与基准模型相差仅 2.7%,性能相近。该模型的代码已在线发布。
引用
@article{arxiv.2208.00987,
title = {DENT-DDSP: Data-efficient noisy speech generator using differentiable digital signal processors for explicit distortion modelling and noise-robust speech recognition},
author = {Z. Guo and C. Chen and E. S. Chng},
journal= {arXiv preprint arXiv:2208.00987},
year = {2022}
}