中文

用于语音识别的深度稀疏 Conformer

计算与语言 2022-09-02 v1 机器学习 声音 音频与语音处理

摘要

Conformer 通过利用 transformer 对基于内容的全局交互的捕获以及卷积神经网络对局部特征的挖掘,在自动语音识别(ASR)中取得了令人印象深刻的成果。在 Conformer 中,两个具有半步残差连接的 macaron 式前馈层夹住多头自注意力与卷积模块,其后接一个后置层归一化。我们从\emph{更稀疏}与\emph{更深}两个方向改进 Conformer 的长序列表示能力。我们采用时间复杂度和内存占用均为 O(LlogL)\mathcal{O}(L\text{log}L) 的稀疏自注意力机制。在执行残差连接时使用深度归一化策略,以确保我们对百级 Conformer 块的训练。在日本 CSJ-500h 数据集上,该深度稀疏 Conformer 在三个评测集上分别取得 5.52%、4.03% 和 4.50% 的 CER,而当集成 12 至 16、17、50 以及最终 100 个编码器层的五个深度稀疏 Conformer 变体时,分别取得 4.16%、2.84% 和 3.20%。

关键词

引用

@article{arxiv.2209.00260,
  title  = {Deep Sparse Conformer for Speech Recognition},
  author = {Xianchao Wu},
  journal= {arXiv preprint arXiv:2209.00260},
  year   = {2022}
}

备注

5 pages, 1 figure