基于 BERT 的非自回归 Transformer 端到端语音识别
计算与语言
2022-05-19 v3 声音
音频与语音处理
摘要
基于 Transformer 的模型已在语音处理、自然语言处理和计算机视觉等迥异的经典与实际课题中带来了显著创新。在 Transformer 之上,基于注意力的端到端自动语音识别(ASR)模型近来已变得流行。具体而言,非自回归建模因推理快速且与传统的自回归方法性能相当,是一个新兴的研究主题。在自然语言处理领域,来自 Transformer 的双向编码器表示(BERT)模型已受到广泛关注,部分原因在于其能够推断上下文化的词表示,并且仅需简单微调即可为下游任务带来优越性能。受此成功启发,我们意图将语音识别视为 BERT 的下游任务,从而期望通过微调来推导出一个 ASR 系统。因此,为了既继承非自回归 ASR 模型的优势,又享受预训练语言模型(如 BERT)的益处,我们提出了一种基于 BERT 的非自回归 Transformer 端到端 ASR 模型。我们在 AISHELL-1 数据集上进行了一系列实验,表明该模型相较于最先进的 ASR 系统取得了具有竞争力或更优的结果。
引用
@article{arxiv.2104.04805,
title = {Non-autoregressive Transformer-based End-to-end ASR using BERT},
author = {Fu-Hao Yu and Kuan-Yu Chen},
journal= {arXiv preprint arXiv:2104.04805},
year = {2022}
}