用于语音识别的对角状态空间增强Transformer
音频与语音处理
2023-03-01 v1 声音
摘要
我们通过用对角状态空间(DSS)模型替换深度方向时间卷积,改进了流行的conformer架构。DSS是近期引入的线性RNN变体,通过对具有对角状态转移矩阵的线性动力学系统进行离散化得到。DSS层将输入序列投影到正交多项式空间,其中基函数、度量和支撑区间的选择由转移矩阵的特征值控制。我们在三个公开语料库上比较了采用conformer或我们提出的DSS增强transformer(DSSformer)编码器的神经转导器:Switchboard英语会话电话语音300小时、Switchboard+Fisher 2000小时,以及名为MALACH 176小时的 Holocaust幸存者证词口语档案。在Switchboard 300/2000小时上,我们在Hub5 2000评估的合并测试集上分别达到8.9%/6.7% WER的单模型性能;在MALACH上,我们相较此前最佳发表结果相对提升了7%的WER。此外,我们给出的经验证据表明,DSS层学习到阻尼傅里叶基函数,其中衰减系数是层特定的,而频率系数在所有层中收敛到几乎相同的线性间隔值。
引用
@article{arxiv.2302.14120,
title = {Diagonal State Space Augmented Transformers for Speech Recognition},
author = {George Saon and Ankit Gupta and Xiaodong Cui},
journal= {arXiv preprint arXiv:2302.14120},
year = {2023}
}
备注
to be presented at ICASSP 2023