中文

端到端中文语音识别中建模单元的可比性研究

计算与语言 2018-05-15 v2 音频与语音处理

摘要

端到端语音识别在中文语音识别中已日益流行并取得了令人满意的性能。中文是一种声调语言,与英文不同,其声学建模单元需要特殊处理。中文已有多种不同的建模单元,如音素、音节和汉字。在本工作中,我们探索两种主要的端到端模型:用于中文语音识别的连接时序分类(CTC)模型和基于注意力的编码器-解码器模型。我们比较了三种不同尺度建模单元的性能:上下文相关音素(CDP)、带声调音节和汉字。我们发现所有类型的建模单元在CTC模型中均可达到近似的字错率(CER),且汉字注意力模型性能优于音节注意力模型。此外,我们发现汉字是中文语音识别的合理单元。在DidiCallcenter任务上,汉字注意力模型达到5.68%的CER,CTC模型达到7.29%;在另一DidiReading任务上,CER分别为4.89%和5.79%。而且,注意力模型在两个数据集上均取得优于CTC模型的性能。

关键词

引用

@article{arxiv.1805.03832,
  title  = {A comparable study of modeling units for end-to-end Mandarin speech recognition},
  author = {Wei Zou and Dongwei Jiang and Shuaijiang Zhao and Xiangang Li},
  journal= {arXiv preprint arXiv:1805.03832},
  year   = {2018}
}

备注

5 pages