基于循环神经网络的普通话声调建模
声音
2017-11-07 v1 音频与语音处理
摘要
我们提出一种编码器-分类器框架,利用循环神经网络(RNN)对普通话声调进行建模。在该框架中,用于声调分类的提取特征帧被输入 RNN,并被映射为固定维向量(声调嵌入),随后通过 softmax 层结合其他辅助输入分类为声调类型。我们研究了有助于改进模型的多种配置,包括池化、特征拼接以及音节级声调嵌入的利用。此外,上下文音节的声调嵌入与时长被用于辅助声调分类。在普通话声调分类上的实验结果表明,所提网络设置提升了声调分类准确率。结果指出,基于 RNN 编码器-分类器的声调模型可灵活容纳异构输入(序列性与分段性),因而兼具序列分类声调模型与分段分类声调模型之优势。
引用
@article{arxiv.1711.01946,
title = {Mandarin tone modeling using recurrent neural networks},
author = {Hao Huang and Ying Hu and Haihua Xu},
journal= {arXiv preprint arXiv:1711.01946},
year = {2017}
}