FAT-HuBERT:用于畸变不变鲁棒语音识别的隐单元BERT前端自适应训练
声音
2023-11-30 v1 音频与语音处理
摘要
单通道语音增强(SE)技术的进展极大改善了语音的感知质量。然而,将这些技术集成到自动语音识别(ASR)系统中并未带来预期的性能提升,主要由于SE过程中引入了畸变。本文中,我们提出一种称为FAT-HuBERT的新方法,其利用畸变不变自监督学习(SSL)来增强ASR的鲁棒性。为应对SE前端引入的畸变,我们引入逐层融合模块,将观测含噪信号与增强信号提取的特征相结合。训练时,SE前端从模型池中随机选取。我们在LibriSpeech生成的仿真含噪语音及CHiME-4单通道数据集的真实世界含噪语音上评估FAT-HuBERT的性能。实验结果表明词错误率(WER)得到显著相对降低。
引用
@article{arxiv.2311.17790,
title = {FAT-HuBERT: Front-end Adaptive Training of Hidden-unit BERT for Distortion-Invariant Robust Speech Recognition},
author = {Dongning Yang and Wei Wang and Yanmin Qian},
journal= {arXiv preprint arXiv:2311.17790},
year = {2023}
}