中文

一种基于词法感知非自回归 Transformer 的 ASR 模型

计算与语言 2023-05-19 v1 声音 音频与语音处理

摘要

非自回归自动语音识别(ASR)因其解码速度快且结果令人满意,已成为 ASR 建模的主流。为进一步提升性能,放宽条件独立假设和级联大规模预训练模型是两个活跃的研究方向。除这些策略外,我们提出一种基于词法感知非自回归 Transformer(LA-NAT)的 ASR 框架,其由声学编码器、语音-文本共享编码器和语音-文本共享解码器组成。声学编码器如常处理输入语音特征,语音-文本共享编码器和解码器旨在同时训练语音与文本数据。如此,LA-NAT 旨在使 ASR 模型感知词法信息,从而期望利用所学语言知识取得更好结果。在 AISHELL-1、CSJ 和 TEDLIUM 2 数据集上进行了一系列实验。实验表明,所提 LA-NAT 可优于其他近期提出的非自回归 ASR 模型。此外,LA-NAT 是比多数非自回归 ASR 模型更紧凑的模型,且比经典自回归模型快约 58 倍。

关键词

引用

@article{arxiv.2305.10839,
  title  = {A Lexical-aware Non-autoregressive Transformer-based ASR Model},
  author = {Chong-En Lin and Kuan-Yu Chen},
  journal= {arXiv preprint arXiv:2305.10839},
  year   = {2023}
}

备注

Accepted by Interspeech 2023