D4AM:一种面向下游声学模型的通用去噪框架
声音
2023-11-29 v1 机器学习
音频与语音处理
摘要
声学模型在噪声环境中的性能会显著下降。语音增强(SE)可用作前端策略以辅助自动语音识别(ASR)系统。然而,现有 SE 方法的训练目标在整合语音-文本与噪声-干净配对数据以面向 unseen ASR 系统进行训练方面并不完全有效。在本研究中,我们提出了一种通用去噪框架 D4AM,用于各种下游声学模型。我们的框架根据特定声学模型及相应分类目标,利用反向梯度对 SE 模型进行微调。此外,我们的方法旨在将回归目标作为辅助损失,使 SE 模型泛化到其他 unseen 声学模型。为了以回归和分类目标联合训练 SE 单元,D4AM 采用一种调整方案来直接估计合适的加权系数,而无需经历带有额外训练成本的网格搜索过程。该调整方案由两部分组成:梯度校准与回归目标加权。实验结果表明,D4AM 能持续有效地改进各种 unseen 声学模型,并优于其他组合设置。具体而言,在使用 SE 训练期间完全 unseen 的真实噪声数据评估 Google ASR API 时,D4AM 相比直接输入噪声相对降低了 24.65% 的 WER。据我们所知,这是首项部署回归(去噪)与分类(ASR)目标的有效组合方案以推导适用于各种 unseen ASR 系统的通用预处理器的工作。我们的代码见 https://github.com/ChangLee0903/D4AM。
引用
@article{arxiv.2311.16595,
title = {D4AM: A General Denoising Framework for Downstream Acoustic Models},
author = {Chi-Chang Lee and Yu Tsao and Hsin-Min Wang and Chu-Song Chen},
journal= {arXiv preprint arXiv:2311.16595},
year = {2023}
}