Conformer:用于语音识别的卷积增强 Transformer
音频与语音处理
2020-05-19 v1 机器学习
声音
摘要
近来,基于 Transformer 与卷积神经网络(CNN)的模型在自动语音识别(ASR)中展现出 promising 结果,优于循环神经网络(RNN)。Transformer 模型善于捕捉基于内容的全局交互,而 CNN 有效利用局部特征。本工作中,我们通过研究如何以参数高效的方式结合卷积神经网络与 Transformer 来建模音频序列的局部与全局依赖,实现了两者优势的结合。为此,我们提出用于语音识别的卷积增强 Transformer,命名为 Conformer。Conformer 显著优于此前的 Transformer 与 CNN 基模型,取得了最先进的准确率。在广泛使用的 LibriSpeech 基准上,我们的模型在无语言模型时取得 test/testother 上 2.1%/4.3% 的 WER,在使用外部语言模型时取得 1.9%/3.9%。我们也观察到仅 10M 参数的小模型取得了 2.7%/6.3% 的竞争力表现。
引用
@article{arxiv.2005.08100,
title = {Conformer: Convolution-augmented Transformer for Speech Recognition},
author = {Anmol Gulati and James Qin and Chung-Cheng Chiu and Niki Parmar and Yu Zhang and Jiahui Yu and Wei Han and Shibo Wang and Zhengdong Zhang and Yonghui Wu and Ruoming Pang},
journal= {arXiv preprint arXiv:2005.08100},
year = {2020}
}
备注
Submitted to Interspeech 2020