面向流式端到端语音识别的双因果/非因果自注意力
音频与语音处理
2021-07-06 v1 机器学习
声音
摘要
基于注意力的端到端自动语音识别(ASR)系统近期在众多任务上展示了最先进的结果。然而,自注意力及基于注意力的编码器-解码器模型在流式 ASR 中的应用仍具挑战性,其中每个词必须在说出后不久即被识别。本工作中,我们提出双因果/非因果自注意力(DCN)架构,与受限自注意力不同,其在深层架构中使用时可防止整体上下文超出单层的向前看范围。使用流式 transformer 与 conformer 架构,将 DCN 与基于分块及受限自注意力进行比较,结果显示其 ASR 性能优于受限自注意力,且与基于分块的自注意力相比具有竞争力的 ASR 结果,同时提供帧同步处理的优势。结合触发注意力,所提出的流式端到端 ASR 系统在 LibriSpeech、HKUST 和 Switchboard ASR 任务上取得了最先进的结果。
引用
@article{arxiv.2107.01269,
title = {Dual Causal/Non-Causal Self-Attention for Streaming End-to-End Speech Recognition},
author = {Niko Moritz and Takaaki Hori and Jonathan Le Roux},
journal= {arXiv preprint arXiv:2107.01269},
year = {2021}
}
备注
Accepted to Interspeech 2021