中文

XLSR-Transducer:面向自监督预训练模型的流式自动语音识别

音频与语音处理 2024-10-10 v2

摘要

自监督预训练模型在微调后的自动语音识别中表现出有竞争力的性能,即使在有限的领域内监督数据下也是如此。然而,流行的预训练模型不适合流式ASR,因为它们是在全注意力上下文中训练的。在本文中,我们介绍了XLSR-Transducer,其中XLSR-53模型被用作transducer设置中的编码器。我们在AMI数据集上的实验表明,XLSR-Transducer相比Whisper large-v2实现了4%的绝对词错误率(WER)改进,相比从头训练的Zipformer transducer模型实现了8%的改进。为了实现流式能力,我们研究了XLSR-53模型中Transformer层自注意力计算中的不同注意力掩码模式。我们在低资源场景下,在AMI和CommonVoice的5种语言上验证了XLSR-Transducer。最后,通过引入注意力汇聚(attention sinks),我们将左上下文减少了一半,同时实现了WER相对12%的改进。

关键词

引用

@article{arxiv.2407.04439,
  title  = {XLSR-Transducer: Streaming ASR for Self-Supervised Pretrained Models},
  author = {Shashi Kumar and Srikanth Madikeri and Juan Zuluaga-Gomez and Esaú Villatoro-Tello and Iuliia Thorbecke and Petr Motlicek and Manjunath K E and Aravind Ganapathiraju},
  journal= {arXiv preprint arXiv:2407.04439},
  year   = {2024}
}

备注

5 pages, double column