中文

基于目标源提取的说话人增强用于鲁棒自动语音识别

音频与语音处理 2022-05-10 v1 声音

摘要

在噪声条件下提高单通道自动语音识别(ASR)的准确率具有挑战性。现有的强语音增强前端通常需要重新训练 ASR 模型以应对处理伪影。本文探索了一种说话人增强策略,可在不重新训练声学模型(AM)的情况下提升识别性能。该方法通过将增强信号与未处理输入重新混合来减轻处理伪影。我们使用基于 DNN 说话人提取、以感知驱动损失函数训练的语音去噪器评估所提方法。结果表明(无需 AM 重训练),相较于未处理输入,我们的方法在单声道模拟和真实 CHiME-4 评估集上分别带来约 23% 和 25% 的相对准确率提升,并优于最先进的参考方法。

关键词

引用

@article{arxiv.2205.04433,
  title  = {Speaker Reinforcement Using Target Source Extraction for Robust Automatic Speech Recognition},
  author = {Catalin Zorila and Rama Doddipatla},
  journal= {arXiv preprint arXiv:2205.04433},
  year   = {2022}
}

备注

Accepted for ICASSP 2022