两阶段训练用于汉语方言识别
计算与语言
2019-08-13 v2 机器学习
音频与语音处理
摘要
本文提出一种两阶段语言识别(LID)系统,基于浅层 ResNet14 后接简单 2 层循环神经网络(RNN)架构,该系统用于讯飞(iFlyTek)汉语方言识别挑战赛,并在 110 支队伍中夺得第一。系统首先用连接时序分类(CTC)训练声学模型(AM)以识别给定的音素序列标注,然后利用 AM 的中间特征作为输入训练另一个 RNN 以分类方言类别。与我们进一步探索的三阶段系统相比,结果表明在两阶段系统下,无论短语音还是长语音条件,都能以更短训练时间实现汉语方言识别的高准确率。
引用
@article{arxiv.1908.02284,
title = {Two-stage Training for Chinese Dialect Recognition},
author = {Zongze Ren and Guofu Yang and Shugong Xu},
journal= {arXiv preprint arXiv:1908.02284},
year = {2019}
}
备注
Accepted to Interspeech 2019