基于 Transformer 的汉语音节序列到序列语音识别
音频与语音处理
2018-06-05 v2 计算与语言
声音
摘要
基于序列到序列注意力的模型近期在自动语音识别(ASR)任务中展现出了极具前景的结果,该模型将声学模型、发音模型和语言模型集成于单个神经网络中。在这些模型中,Transformer 是一种完全依赖自注意力而不使用 RNN 或卷积的新型序列到序列注意力模型,在神经机器翻译(NMT)任务中取得了单模型 SOTA BLEU 分数。鉴于 Transformer 的优异性能,我们将其扩展至语音领域,并将其作为汉语 ASR 任务中基于序列到序列注意力模型的基础架构。此外,我们在汉语中研究了基于音节的模型与基于上下文无关音素(CI-phoneme)的模型在 Transformer 上的比较。另外,我们提出了一种结合 Transformer 的贪婪级联解码器,用于将 CI-phoneme 序列和音节序列映射为词序列。在 HKUST 数据集上的实验表明,基于音节的 Transformer 模型性能优于基于 CI-phoneme 的对应模型,并达到了 28.77% 的字符错误率(CER),与基于联合 CTC-attention 的编码器-解码器网络 28.0% 的 SOTA CER 具有竞争力。
关键词
引用
@article{arxiv.1804.10752,
title = {Syllable-Based Sequence-to-Sequence Speech Recognition with the Transformer in Mandarin Chinese},
author = {Shiyu Zhou and Linhao Dong and Shuang Xu and Bo Xu},
journal= {arXiv preprint arXiv:1804.10752},
year = {2018}
}
备注
accepted by INTERSPEECH2018