中文

用于语音识别的渐进多尺度自监督学习

音频与语音处理 2022-12-08 v1 声音

摘要

自监督学习(SSL)模型在自动语音识别(ASR)中取得了显著改进。此外,若模型在理论上专注于音频内容信息学习,ASR 性能可进一步提升。为此,我们提出一种渐进多尺度自监督学习(PMS-SSL)方法,其在顶层使用细粒度目标集计算 SSL 损失,而在中间层使用粗粒度目标集。此外,PMS-SSL 将多尺度结构引入多头自注意力以获得更好的语音表征,其在较高层将注意力范围限制为大范围,而在较低层将注意力范围限制为小范围。在 Librispeech 数据集上的实验表明了我们所提方法的有效性。与 HuBERT 相比,PMS-SSL 在 10 小时 / 100 小时子集上微调时,在 test other 评估子集上分别实现了 13.7% / 12.7% 的相对词错率降低。

关键词

引用

@article{arxiv.2212.03480,
  title  = {Progressive Multi-Scale Self-Supervised Learning for Speech Recognition},
  author = {Genshun Wan and Tan Liu and Hang Chen and Jia Pan and Cong Liu and Zhongfu Ye},
  journal= {arXiv preprint arXiv:2212.03480},
  year   = {2022}
}

备注

Submitted to ICASSP 2023