中文

用于语音识别的注意力增强 Citrinet

计算与语言 2022-09-02 v1 机器学习 声音 音频与语音处理

摘要

Citrinet 是一种基于端到端卷积连接时序分类(CTC)的自动语音识别(ASR)模型。为捕获局部与全局上下文信息,Citrinet 中使用了 1D 时间-通道可分离卷积结合子词编码与挤压激励(SE),使整体架构深达包含 23 个块、235 个卷积层与 46 个线性层。这种纯卷积的深度架构使 Citrinet 收敛相对缓慢。本文中,我们提出在 Citrinet 块的卷积模块中引入多头注意力与前馈网络,同时保持 SE 模块与残差模块不变。为加速,我们在每个注意力增强 Citrinet 块中移除 8 个卷积层,并将 23 个块减至 13 个。在日本 CSJ-500h 与 Magic-1600h 数据集上的实验表明,层数块数更少的注意力增强 Citrinet 收敛更快,且字符错误率低于(1) 训练时间 80% 的 Citrinet 与(2) 训练时间 40%、模型大小 29.8% 的 Conformer。

关键词

引用

@article{arxiv.2209.00261,
  title  = {Attention Enhanced Citrinet for Speech Recognition},
  author = {Xianchao Wu},
  journal= {arXiv preprint arXiv:2209.00261},
  year   = {2022}
}

备注

5 pages, 3 figures