中文

用于 ASR 的联合编码器-解码器自监督预训练

计算与语言 2022-06-10 v1

摘要

自监督学习(SSL)在各种语音相关的下游任务中取得了巨大成功,包括自动语音识别(ASR)。SSL 模型的输出嵌入被视为语音信号强大的短时表示。然而,在 ASR 任务中,主要目标是获得声学单元、字符或字节对编码(BPE)的正确序列。通常,编码器-解码器架构在诸如 ASR 这样的序列到序列任务上表现极为出色。因此,在本文中,我们提出了一种利用解码器在自监督学习期间能力的新范式。我们使用 Hidden Unit BERT(HuBERT)SSL 框架为编码器计算常规的掩码预测损失。此外,我们在 SSL 框架中引入了解码器,并提出了一种针对解码器的目标准备策略。最后,我们使用多任务 SSL 设置,其中联合优化编码器和解码器损失。我们假设 SSL 模型中存在解码器有助于其学习基于声学单元的语言模型,这可能会改善 ASR 下游任务的性能。我们将我们提出的 SSL 模型与 HuBERT 进行比较,并显示出通过在各种 LibriSpeech 子集上微调,在 ASR 上性能相对提升高达 25%。

关键词

引用

@article{arxiv.2206.04465,
  title  = {Joint Encoder-Decoder Self-Supervised Pre-training for ASR},
  author = {Arunkumar A and Umesh S},
  journal= {arXiv preprint arXiv:2206.04465},
  year   = {2022}
}

备注

Submitted to Interspeech 2022