基于 Transformer 的在线 CTC/注意力端到端语音识别架构
音频与语音处理
2020-02-12 v2 机器学习
神经与进化计算
声音
机器学习
摘要
近年来,Transformer 在自动语音识别(ASR)领域取得了成功。然而,部署基于 Transformer 的端到端(E2E)模型用于在线语音识别仍具挑战性。本文提出基于 Transformer 的在线 CTC/注意力 E2E ASR 架构,其包含分块自注意力编码器(chunk-SAE)与基于单调截断注意力(MTA)的自注意力解码器(SAD)。首先,chunk-SAE 将语音切分为孤立块;为降低计算开销并提升性能,我们提出状态复用 chunk-SAE。其次,基于 MTA 的 SAD 对语音特征进行单调截断,并在截断后的特征上执行注意力。为支持在线识别,我们将状态复用 chunk-SAE 与基于 MTA 的 SAD 集成到在线 CTC/注意力架构中。我们在 HKUST 普通话 ASR 基准上评估所提在线模型,以 320 ms 延迟取得了 23.66% 的字错误率(CER)。与离线基线相比,我们的在线模型绝对 CER 退化仅 0.19%,且较我们此前基于长短期记忆(LSTM)的在线 E2E 模型有显著提升。
引用
@article{arxiv.2001.08290,
title = {Transformer-based Online CTC/attention End-to-End Speech Recognition Architecture},
author = {Haoran Miao and Gaofeng Cheng and Changfeng Gao and Pengyuan Zhang and Yonghong Yan},
journal= {arXiv preprint arXiv:2001.08290},
year = {2020}
}
备注
Accepted by ICASSP 2020