用于普通话语音识别的金字塔多分支融合DCNN与多头自注意力模型
音频与语音处理
2023-03-24 v1 声音
摘要
作为自动语音识别的主要分支之一,基于注意力的模型极大地提升了模型的特征表示能力。特别地,注意力中采用了多头机制,期望在不同注意力子空间中学习更多方面的语音特征。对于复杂语言的语音识别,一方面,较小的头数会导致可学习方面的明显不足。另一方面,为在增加头数的同时保持整体特征空间大小不变,我们需要降低每个子空间的维度,这将显著削弱每个子空间表示特征的能力。因此,本文探讨如何在保证多头的同时使用较小的注意力子空间来表示完整的语音特征。为此,我们提出了一种新颖的神经网络架构,即带有多头自注意力的金字塔多分支融合 DCNN。所提架构受膨胀卷积神经网络(DCNN)启发,使用多个带 DCNN 的分支在不同感受野下提取输入语音的特征。为减少参数量,每两个分支合并一次,直到所有分支合并为一个。因此,其形状类似于旋转 90 度的金字塔。我们证明,在广泛使用的中文语音数据集 Aishell-1 上,我们的模型在测试集上取得了 6.45% 的字错误率(CER)。
引用
@article{arxiv.2303.13243,
title = {Pyramid Multi-branch Fusion DCNN with Multi-Head Self-Attention for Mandarin Speech Recognition},
author = {Kai Liu and Hailiang Xiong and Gangqiang Yang and Zhengfeng Du and Yewen Cao and Danyal Shah},
journal= {arXiv preprint arXiv:2303.13243},
year = {2023}
}