面向语言识别的端到端学习方案探析
音频与语音处理
2018-04-03 v1 机器学习
声音
摘要
提出了一种新颖可解释的语言识别端到端学习方案。它在理论和实践上均与经典 GMM i-vector 方法一致。在端到端流程中,在前端 CNN 之上采用一个通用编码层,从而可自动将变长输入序列编码为语句级向量。在与最先进的 GMM i-vector 方法比较后,我们深入考察 CNN,并揭示其在整个流程中的作用与效果。我们进一步引入通用编码层,阐明其可能适用于语言识别的原因。我们详细阐述了几种典型编码层,包括时间平均池化层、循环编码层以及一种新颖的可学习字典编码层。我们在 NIST LRE07 闭集任务上进行了实验,结果表明我们提出的端到端系统达到了最先进的性能。
引用
@article{arxiv.1804.00381,
title = {Insights into End-to-End Learning Scheme for Language Identification},
author = {Weicheng Cai and Zexin Cai and Wenbo Liu and Xiaoqi Wang and Ming Li},
journal= {arXiv preprint arXiv:1804.00381},
year = {2018}
}
备注
ICASSP 2018 conference paper