中文

Conformer:用于语音识别的卷积增强 Transformer

音频与语音处理 2020-05-19 v1 机器学习 声音

摘要

近来,基于 Transformer 与卷积神经网络(CNN)的模型在自动语音识别(ASR)中展现出 promising 结果,优于循环神经网络(RNN)。Transformer 模型善于捕捉基于内容的全局交互,而 CNN 有效利用局部特征。本工作中,我们通过研究如何以参数高效的方式结合卷积神经网络与 Transformer 来建模音频序列的局部与全局依赖,实现了两者优势的结合。为此,我们提出用于语音识别的卷积增强 Transformer,命名为 Conformer。Conformer 显著优于此前的 Transformer 与 CNN 基模型,取得了最先进的准确率。在广泛使用的 LibriSpeech 基准上,我们的模型在无语言模型时取得 test/testother 上 2.1%/4.3% 的 WER,在使用外部语言模型时取得 1.9%/3.9%。我们也观察到仅 10M 参数的小模型取得了 2.7%/6.3% 的竞争力表现。

关键词

引用

@article{arxiv.2005.08100,
  title  = {Conformer: Convolution-augmented Transformer for Speech Recognition},
  author = {Anmol Gulati and James Qin and Chung-Cheng Chiu and Niki Parmar and Yu Zhang and Jiahui Yu and Wei Han and Shibo Wang and Zhengdong Zhang and Yonghui Wu and Ruoming Pang},
  journal= {arXiv preprint arXiv:2005.08100},
  year   = {2020}
}

备注

Submitted to Interspeech 2020