中文

基于多头自注意力与一维卷积神经网络的端到端语言识别

音频与语音处理 2021-02-02 v1

摘要

在这项工作中,我们提出了一种用于印度语言识别的新方法,该方法将多头自注意力与基于原始波形的的一维卷积神经网络相结合。我们的方法使用编码器、多头自注意力和统计池化层。编码器通过一维卷积核和 LSTM 层直接从原始波形中学习特征。LSTM 层捕获由一维卷积层提取的特征之间的时间信息。多头自注意力层接收 LSTM 层的输出,并以 M 个不同的头对这些特征施加自注意力机制。此过程有助于模型对更有用的特征赋予更高权重,对较不相关的特征赋予较低权重。最后,使用统计池化层将帧级特征组合以提取话语级特征向量标签预测。我们在 373 小时的八种不同印度语言音频数据上进行了所有实验。我们的实验表明,我们的方法在 F1 分数上比基线模型绝对提升 3.69%,并取得了 95.90% 的最佳 F1 分数。我们的方法还表明,与使用手工特征的模型相比,使用原始波形模型的性能提升 1.7%。

关键词

引用

@article{arxiv.2102.00306,
  title  = {End-to-End Language Identification using Multi-Head Self-Attention and 1D Convolutional Neural Networks},
  author = {Krishna D N and Ankita Patil},
  journal= {arXiv preprint arXiv:2102.00306},
  year   = {2021}
}

备注

5 pages, 1 figure