MLP-ASR:适用于任意序列长度的全 MLP 语音识别架构
音频与语音处理
2022-02-18 v1 机器学习
声音
摘要
我们提出适用于变长输入的多层感知机(MLP)架构。近期为图像分类提出的基于 MLP 的架构只能用于固定、预定义尺寸的输入。然而,许多类型的数据天然具有可变长度,例如声学信号。我们提出三种扩展基于 MLP 的架构以处理任意长度序列的方法。第一种使用在傅里叶域中应用的循环卷积,第二种应用深度可分离卷积,最后一种依赖于移位操作。我们在 Librispeech 和 Tedlium2 语料库的自动语音识别任务上评估所提架构。最佳提出的基于 MLP 的架构在使用自注意力架构 86.4% 参数量的情况下,在 Librispeech 的 dev-clean/dev-other、test-clean/test-other 集上分别将 WER 降低 1.0 / 0.9%、0.9 / 0.5%,在 Tedlium2 的 dev/test 集上降低 0.8 / 1.1%。
引用
@article{arxiv.2202.08456,
title = {MLP-ASR: Sequence-length agnostic all-MLP architectures for speech recognition},
author = {Jin Sakuma and Tatsuya Komatsu and Robin Scheibler},
journal= {arXiv preprint arXiv:2202.08456},
year = {2022}
}
备注
8 pages, 4 figures