中文

分析自监督预训练表示对语音识别有用性的影响因素

计算与语言 2023-05-19 v4 声音 音频与语音处理

摘要

自监督学习(SSL)用于学习高层语音表示,已成为在低资源环境下构建自动语音识别(ASR)系统的流行方法。然而,文献中常见的假设是,有大量来自同一领域或语言的未标注数据可用于 SSL 预训练,我们承认这在真实场景中并不可行。在本文中,作为 Interspeech Gram Vaani ASR 挑战赛的一部分,我们试图研究上游预训练 SSL 数据的领域、语言、数据集规模及其他方面对最终低资源下游 ASR 任务性能的影响。我们还基于持续预训练范式,研究使用 SSL 训练的模型所具备的先验知识的影响。大量实验与研究揭示,ASR 系统的性能易受用于 SSL 预训练的数据影响。其性能随预训练数据相似度与量的增加而提升。我们相信,我们的工作将有助于语音界在低资源环境下构建更好的 ASR 系统,并引导研究朝向提升基于 SSL 的语音系统预训练的泛化能力发展。

关键词

引用

@article{arxiv.2203.16973,
  title  = {Analyzing the factors affecting usefulness of Self-Supervised Pre-trained Representations for Speech Recognition},
  author = {Ashish Seth and Lodagala V S V Durga Prasad and Sreyan Ghosh and S. Umesh},
  journal= {arXiv preprint arXiv:2203.16973},
  year   = {2023}
}