Transformer 与 RNN 在语音应用中的比较研究
计算与语言
2021-06-10 v2 声音
音频与语音处理
摘要
序列到序列模型已广泛用于端到端语音处理,例如自动语音识别(ASR)、语音翻译(ST)和文本到语音(TTS)。本文关注一种新兴的序列到序列模型 Transformer,它在神经机器翻译及其他自然语言处理应用中取得了最先进的性能。我们开展了深入的研究,通过实验在总计 15 个 ASR、一个多语言 ASR、一个 ST 以及两个 TTS 基准上比较并分析了 Transformer 与传统的循环神经网络(RNN)。我们的实验揭示了各类训练技巧,以及 Transformer 在各项任务中获得的显著性能优势,包括在与 RNN 比较时 Transformer 在 15 个 ASR 基准中的 13 个上令人惊讶的优越性。我们正准备使用开源及公开可用数据集,为所有 ASR、ST 和 TTS 任务发布 Kaldi 风格的可复现配方,以供社区延续我们令人振奋的成果。
引用
@article{arxiv.1909.06317,
title = {A Comparative Study on Transformer vs RNN in Speech Applications},
author = {Shigeki Karita and Nanxin Chen and Tomoki Hayashi and Takaaki Hori and Hirofumi Inaguma and Ziyan Jiang and Masao Someki and Nelson Enrique Yalta Soplin and Ryuichi Yamamoto and Xiaofei Wang and Shinji Watanabe and Takenori Yoshimura and Wangyou Zhang},
journal= {arXiv preprint arXiv:1909.06317},
year = {2021}
}
备注
Accepted at ASRU 2019