Transformer、卷积与循环神经网络在音素识别上的比较
音频与语音处理
2022-10-04 v1 计算与语言
摘要
音素识别是语音识别中非常重要的一部分,需要从多帧中提取语音特征。本文使用音素识别对 CNN、RNN、Transformer 和 Conformer 模型进行比较与分析。对于 CNN,实验采用 ContextNet 模型。首先,我们在不同约束条件(如感受野长度、参数量大小和层数深度)下比较各种架构的准确率。其次,我们解释这些模型的性能差异,尤其是在可观测序列长度变化时。我们的分析表明,Transformer 和 Conformer 模型通过输入帧的自注意力长程可达性获益。
引用
@article{arxiv.2210.00367,
title = {A Comparison of Transformer, Convolutional, and Recurrent Neural Networks on Phoneme Recognition},
author = {Kyuhong Shim and Wonyong Sung},
journal= {arXiv preprint arXiv:2210.00367},
year = {2022}
}