中文

超越Universal Transformer:用于自动语音识别的Transformer模块复用与适配模块

声音 2023-04-06 v2 计算与语言 音频与语音处理

摘要

基于Transformer的模型最近在端到端(E2E)自动语音识别(ASR)的应用中取得了显著成就。借助基于Transformer的模型,可以将E2E ASR系统部署在智能设备上。然而这些模型仍有需要大量模型参数的缺点。为克服Universal Transformer模型在边缘设备上用于ASR应用的缺陷,我们提出了一种在小型ASR系统场景下复用Transformer中模块的解决方案,该方案在不损害识别精度的前提下满足了适应资源限制的目标。具体而言,我们为语音Transformer设计了新颖的模块复用策略(BRST)以提升参数有效性,并提出了适配模块(ADM),该模块可在每个复用模块仅伴随少量额外可训练参数的情况下生成紧凑且可适应的模型。我们在公开AISHELL-1语料库上使用所提方法进行了实验,结果表明,在不使用和使用ADM的情况下,所提方法仅以7.6M/8.3M参数分别取得了9.3%/6.63%的字错误率(CER)。此外,我们还进行了更深入的分析以展示ADM在通用模块复用方法中的作用。

关键词

引用

@article{arxiv.2303.13072,
  title  = {Beyond Universal Transformer: block reusing with adaptor in Transformer for automatic speech recognition},
  author = {Haoyu Tang and Zhaoyi Liu and Chang Zeng and Xinfeng Li},
  journal= {arXiv preprint arXiv:2303.13072},
  year   = {2023}
}