中文

基于注意力机制的采用轻量与动态卷积的 ASR

音频与语音处理 2020-02-21 v2

摘要

基于序列到序列模型的端到端 (E2E) 自动语音识别 (ASR) 因相比传统的基于隐马尔可夫模型的 ASR 具有更简单的模型训练而受到关注。近来,若干研究报道了由 Transformer 取得的业界最优 E2E ASR 结果。与基于循环神经网络 (RNN) 的 E2E 模型相比,Transformer 的训练更高效且在多项任务上取得更好性能。然而,Transformer 中使用的自注意力在其输入长度上需要二次计算量。本文中,我们提出将轻量与动态卷积应用于 E2E ASR,作为自注意力的替代架构,以使计算阶数变为线性。我们还提出与连接主义时序分类的联合训练、频率轴上的卷积以及与自注意力的结合。借助这些技术,所提架构取得了优于基于 RNN 的 E2E 模型的性能,并与各种 ASR 基准测试(包括含噪声/混响任务)上的业界最优 Transformer 性能相当。

关键词

引用

@article{arxiv.1912.11793,
  title  = {Attention-based ASR with Lightweight and Dynamic Convolutions},
  author = {Yuya Fujita and Aswin Shanmugam Subramanian and Motoi Omachi and Shinji Watanabe},
  journal= {arXiv preprint arXiv:1912.11793},
  year   = {2020}
}

备注

ICASSP 2020