中文

用于 2019 多体裁广播挑战赛中方言识别的带卷积前端的 LSTM-TDNN

音频与语音处理 2019-12-20 v1 计算与语言 声音

摘要

本文提出了一种为第五届多体裁广播挑战赛(细粒度阿拉伯方言识别 MGB-5 ADI 挑战赛任务)开发的新型方言识别 (DID) 系统。该系统通过采用卷积与长短期记忆-循环 (CLSTM) 架构,结合卷积神经网络前端进行特征提取与后端循环神经网络捕捉更长时序依赖的优势,改进了传统 DNN x-vector 的性能。此外,我们研究了在高度不平衡的训练集中使用时间尺度修改 (TSM) 对一种低资源方言进行密集增强。这将一条语音转换为多个时间拉伸或时间压缩的版本,随后用于训练 CLSTM 系统而无需使用任何其他语料库。在本文中,我们还研究了使用 MUSAN 与 RIR 数据集以常规方式增加现有训练数据的量与多样性来进行语音增强。结果表明:首先,CLSTM 架构优于传统 DNN x-vector 实现;其次,采用基于 TSM 的速度扰动对不平衡数据带来微小性能提升;最后,传统数据增强技术带来进一步益处,与相关说话人与语言识别任务中的证据一致。我们的系统在 MGB-5 ADI 挑战赛(于 ASRU 2019 举办)的 15 个参赛作品中排名第二。

关键词

引用

@article{arxiv.1912.09003,
  title  = {LSTM-TDNN with convolutional front-end for Dialect Identification in the 2019 Multi-Genre Broadcast Challenge},
  author = {Xiaoxiao Miao and Ian McLoughlin},
  journal= {arXiv preprint arXiv:1912.09003},
  year   = {2019}
}