基于目标源提取的说话人增强用于鲁棒自动语音识别
音频与语音处理
2022-05-10 v1 声音
摘要
在噪声条件下提高单通道自动语音识别(ASR)的准确率具有挑战性。现有的强语音增强前端通常需要重新训练 ASR 模型以应对处理伪影。本文探索了一种说话人增强策略,可在不重新训练声学模型(AM)的情况下提升识别性能。该方法通过将增强信号与未处理输入重新混合来减轻处理伪影。我们使用基于 DNN 说话人提取、以感知驱动损失函数训练的语音去噪器评估所提方法。结果表明(无需 AM 重训练),相较于未处理输入,我们的方法在单声道模拟和真实 CHiME-4 评估集上分别带来约 23% 和 25% 的相对准确率提升,并优于最先进的参考方法。
引用
@article{arxiv.2205.04433,
title = {Speaker Reinforcement Using Target Source Extraction for Robust Automatic Speech Recognition},
author = {Catalin Zorila and Rama Doddipatla},
journal= {arXiv preprint arXiv:2205.04433},
year = {2022}
}
备注
Accepted for ICASSP 2022