中文

探究用于病理语音识别的自监督预训练框架

声音 2022-06-30 v3 音频与语音处理

摘要

我们研究了自监督预训练框架在用于自动语音识别(ASR)的病理语音数据集上的性能。现代端到端模型需要数千小时的数据才能训练良好,但公开可用的病理语音数据集数量很少。对此问题的一个成熟解决方案是先在大量健康语音数据集上预训练模型,然后在病理语音数据集上微调。一种称为自监督学习(SSL)的新预训练框架仅使用语音数据训练网络,在训练数据需求上提供了更大的灵活性,并允许在预训练中使用更多语音数据。我们使用不同的设置研究了 wav2vec 2.0 和 WavLM 等 SSL 框架,并将其性能与不同的有监督预训练设置进行比较,所用病理语音为两类:日语电子喉语音和英语构音障碍语音。我们的结果表明,尽管 SSL 在极少资源的健康语音上已取得成功,但我们发现其在病理语音上并非如此。最佳有监督设置相比最佳 SSL 设置在电子喉语音上字符错误率低 13.9%,在构音障碍语音上词错误率低 16.8%。

关键词

引用

@article{arxiv.2203.15431,
  title  = {Investigating Self-supervised Pretraining Frameworks for Pathological Speech Recognition},
  author = {Lester Phillip Violeta and Wen-Chin Huang and Tomoki Toda},
  journal= {arXiv preprint arXiv:2203.15431},
  year   = {2022}
}

备注

Accepted to INTERSPEECH 2022