中文

基于 Transformer 的序列到序列语音识别中建模单元在汉语上的比较

音频与语音处理 2018-05-22 v2 计算与语言 声音

摘要

建模单元的选择对自动语音识别(ASR)任务至关重要。传统的 ASR 系统通常选择上下文相关状态(CD-states)或上下文相关音素(CD-phonemes)作为建模单元。然而,它已受到序列到序列基于注意力的模型的挑战,后者将声学、发音和语言模型集成到单一神经网络中。在英语 ASR 任务上,先前的尝试已表明,通过序列到序列基于注意力的模型,字素作为建模单元的表现优于音素。本文关注使用带 Transformer 的序列到序列基于注意力的模型在汉语 ASR 任务上的建模单元。探索了五种建模单元,包括上下文无关音素(CI-phonemes)、音节、词、子词和字符。在 HKUST 数据集上的实验表明,无词典建模单元在字符错误率(CER)方面优于与词典相关的建模单元。在五种建模单元中,基于字符的模型表现最佳,并在 HKUST 数据集上建立了 26.64%26.64\% 的新的最先进 CER,无需人工设计的词典和额外的语言模型集成,相对于现有联合 CTC-注意力编码器-解码器网络的最佳 CER 28.0%28.0\% 实现了 4.8%4.8\% 的相对提升。

关键词

引用

@article{arxiv.1805.06239,
  title  = {A Comparison of Modeling Units in Sequence-to-Sequence Speech Recognition with the Transformer on Mandarin Chinese},
  author = {Shiyu Zhou and Linhao Dong and Shuang Xu and Bo Xu},
  journal= {arXiv preprint arXiv:1805.06239},
  year   = {2018}
}

备注

arXiv admin note: substantial text overlap with arXiv:1804.10752