中文

面向流式端到端语音识别的双因果/非因果自注意力

音频与语音处理 2021-07-06 v1 机器学习 声音

摘要

基于注意力的端到端自动语音识别(ASR)系统近期在众多任务上展示了最先进的结果。然而,自注意力及基于注意力的编码器-解码器模型在流式 ASR 中的应用仍具挑战性,其中每个词必须在说出后不久即被识别。本工作中,我们提出双因果/非因果自注意力(DCN)架构,与受限自注意力不同,其在深层架构中使用时可防止整体上下文超出单层的向前看范围。使用流式 transformer 与 conformer 架构,将 DCN 与基于分块及受限自注意力进行比较,结果显示其 ASR 性能优于受限自注意力,且与基于分块的自注意力相比具有竞争力的 ASR 结果,同时提供帧同步处理的优势。结合触发注意力,所提出的流式端到端 ASR 系统在 LibriSpeech、HKUST 和 Switchboard ASR 任务上取得了最先进的结果。

关键词

引用

@article{arxiv.2107.01269,
  title  = {Dual Causal/Non-Causal Self-Attention for Streaming End-to-End Speech Recognition},
  author = {Niko Moritz and Takaaki Hori and Jonathan Le Roux},
  journal= {arXiv preprint arXiv:2107.01269},
  year   = {2021}
}

备注

Accepted to Interspeech 2021