用于语音识别的深度稀疏 Conformer
计算与语言
2022-09-02 v1 机器学习
声音
音频与语音处理
摘要
Conformer 通过利用 transformer 对基于内容的全局交互的捕获以及卷积神经网络对局部特征的挖掘,在自动语音识别(ASR)中取得了令人印象深刻的成果。在 Conformer 中,两个具有半步残差连接的 macaron 式前馈层夹住多头自注意力与卷积模块,其后接一个后置层归一化。我们从\emph{更稀疏}与\emph{更深}两个方向改进 Conformer 的长序列表示能力。我们采用时间复杂度和内存占用均为 的稀疏自注意力机制。在执行残差连接时使用深度归一化策略,以确保我们对百级 Conformer 块的训练。在日本 CSJ-500h 数据集上,该深度稀疏 Conformer 在三个评测集上分别取得 5.52%、4.03% 和 4.50% 的 CER,而当集成 12 至 16、17、50 以及最终 100 个编码器层的五个深度稀疏 Conformer 变体时,分别取得 4.16%、2.84% 和 3.20%。
引用
@article{arxiv.2209.00260,
title = {Deep Sparse Conformer for Speech Recognition},
author = {Xianchao Wu},
journal= {arXiv preprint arXiv:2209.00260},
year = {2022}
}
备注
5 pages, 1 figure