中文

FAT-HuBERT:用于畸变不变鲁棒语音识别的隐单元BERT前端自适应训练

声音 2023-11-30 v1 音频与语音处理

摘要

单通道语音增强(SE)技术的进展极大改善了语音的感知质量。然而,将这些技术集成到自动语音识别(ASR)系统中并未带来预期的性能提升,主要由于SE过程中引入了畸变。本文中,我们提出一种称为FAT-HuBERT的新方法,其利用畸变不变自监督学习(SSL)来增强ASR的鲁棒性。为应对SE前端引入的畸变,我们引入逐层融合模块,将观测含噪信号与增强信号提取的特征相结合。训练时,SE前端从模型池中随机选取。我们在LibriSpeech生成的仿真含噪语音及CHiME-4单通道数据集的真实世界含噪语音上评估FAT-HuBERT的性能。实验结果表明词错误率(WER)得到显著相对降低。

关键词

引用

@article{arxiv.2311.17790,
  title  = {FAT-HuBERT: Front-end Adaptive Training of Hidden-unit BERT for Distortion-Invariant Robust Speech Recognition},
  author = {Dongning Yang and Wei Wang and Yanmin Qian},
  journal= {arXiv preprint arXiv:2311.17790},
  year   = {2023}
}