用于语音识别的渐进多尺度自监督学习
音频与语音处理
2022-12-08 v1 声音
摘要
自监督学习(SSL)模型在自动语音识别(ASR)中取得了显著改进。此外,若模型在理论上专注于音频内容信息学习,ASR 性能可进一步提升。为此,我们提出一种渐进多尺度自监督学习(PMS-SSL)方法,其在顶层使用细粒度目标集计算 SSL 损失,而在中间层使用粗粒度目标集。此外,PMS-SSL 将多尺度结构引入多头自注意力以获得更好的语音表征,其在较高层将注意力范围限制为大范围,而在较低层将注意力范围限制为小范围。在 Librispeech 数据集上的实验表明了我们所提方法的有效性。与 HuBERT 相比,PMS-SSL 在 10 小时 / 100 小时子集上微调时,在 test other 评估子集上分别实现了 13.7% / 12.7% 的相对词错率降低。
引用
@article{arxiv.2212.03480,
title = {Progressive Multi-Scale Self-Supervised Learning for Speech Recognition},
author = {Genshun Wan and Tan Liu and Hang Chen and Jia Pan and Cong Liu and Zhongfu Ye},
journal= {arXiv preprint arXiv:2212.03480},
year = {2022}
}
备注
Submitted to ICASSP 2023