中文

Transformer、卷积与循环神经网络在音素识别上的比较

音频与语音处理 2022-10-04 v1 计算与语言

摘要

音素识别是语音识别中非常重要的一部分,需要从多帧中提取语音特征。本文使用音素识别对 CNN、RNN、Transformer 和 Conformer 模型进行比较与分析。对于 CNN,实验采用 ContextNet 模型。首先,我们在不同约束条件(如感受野长度、参数量大小和层数深度)下比较各种架构的准确率。其次,我们解释这些模型的性能差异,尤其是在可观测序列长度变化时。我们的分析表明,Transformer 和 Conformer 模型通过输入帧的自注意力长程可达性获益。

关键词

引用

@article{arxiv.2210.00367,
  title  = {A Comparison of Transformer, Convolutional, and Recurrent Neural Networks on Phoneme Recognition},
  author = {Kyuhong Shim and Wonyong Sung},
  journal= {arXiv preprint arXiv:2210.00367},
  year   = {2022}
}