中文

基于跨语言自监督语音表征改善构音障碍语音识别

计算与语言 2022-04-05 v1 声音 音频与语音处理

摘要

最先进的自动语音识别(ASR)系统在健康语音上表现良好。然而,其在受损语音上的性能仍然是一个问题。本研究探讨了使用 Wav2Vec 自监督语音表征作为特征来训练构音障碍语音 ASR 系统的有用性。构音障碍语音识别尤其困难,因为语音的多个方面(如发音、韵律和发声)都可能受损。具体而言,我们使用从 Wav2Vec、Hubert 以及跨语言 XLSR 模型提取的特征来训练声学模型。结果表明,在大型无标注数据上预训练的语音表征能够改善词错误率(WER)性能。特别是,多语言模型的特征比滤波器组(Fbank)或在单一语言上训练的模型带来了更低的 WER。在由脑瘫引起的构音障碍的英语说话人(UASpeech 语料库)、帕金森性构音障碍的西班牙语说话人(PC-GITA 语料库)以及基于麻痹的构音障碍的意大利语说话人(EasyCall 语料库)中均观察到了改善。与使用 Fbank 特征相比,XLSR 基特征在 UASpeech、PC-GITA 和 EasyCall 语料库上分别将 WER 降低了 6.8%、22.0% 和 7.0%。

关键词

引用

@article{arxiv.2204.01670,
  title  = {Cross-lingual Self-Supervised Speech Representations for Improved Dysarthric Speech Recognition},
  author = {Abner Hernandez and Paula Andrea Pérez-Toro and Elmar Nöth and Juan Rafael Orozco-Arroyave and Andreas Maier and Seung Hee Yang},
  journal= {arXiv preprint arXiv:2204.01670},
  year   = {2022}
}

备注

Submitted for review at Interspeech 2022