用于端到端口音识别的卷积神经网络与语言嵌入
声音
2018-04-24 v2 音频与语音处理
摘要
方言识别(DID)是通用语言识别(LID)的一种特例,但由于方言间语言学的相似性,它是一个更具挑战性的问题。在本文中,我们提出了一种端到端口音识别系统与一种孪生神经网络来提取语言嵌入。我们在阿拉伯方言语音数据集Multi-Genre Broadcast 3(MGB-3)上同时使用声学与语言学特征进行DID任务。该端到端口音识别系统使用三类声学特征训练:梅尔频率倒谱系数(MFCCs)、对数梅尔尺度滤波器组能量(FBANK)与谱图能量。我们还研究了一种数据集增强方法,以在有限数据资源下实现稳健性能。我们的语言学特征研究聚焦于利用孪生网络学习方言间的相似与不相似,从而能够降低特征维度并提升DID性能。使用单一特征集的最佳系统达到了73%的准确率,而使用多特征融合的系统在由5种方言组成的MGB-3方言测试集上达到了78%。实验结果表明FBANK特征取得的結果略优于MFCCs。通过速度扰动的数据库增强似乎为系统增添了显著的稳健性。尽管带语言嵌入的孪生网络未能取得与端到端口音识别系统一样好的结果,但这两种方法在融合系统中结合时具有良好的协同作用。
引用
@article{arxiv.1803.04567,
title = {Convolutional Neural Networks and Language Embeddings for End-to-End Dialect Recognition},
author = {Suwon Shon and Ahmed Ali and James Glass},
journal= {arXiv preprint arXiv:1803.04567},
year = {2018}
}
备注
Speaker Odyssey 2018, The Speaker and Language Recognition Workshop