中文

BECTRA:基于转导器且采用 BERT 增强编码器的端到端语音识别模型

音频与语音处理 2023-03-20 v2 计算与语言 声音

摘要

我们提出了 BERT-CTC-Transducer (BECTRA),一种由转导器与 BERT 增强编码器构成的新型端到端自动语音识别 (E2E-ASR) 模型。将大规模预训练语言模型 (LM) 集成到 E2E-ASR 中已被积极研究,旨在利用通用的语言知识生成准确文本。造成该集成困难的一个关键因素在于词表不匹配;为预训练 LM 构建的词表通常对 E2E-ASR 训练而言过大,且可能与目标 ASR 领域不匹配。为克服此问题,我们提出了 BECTRA,即我们先前 BERT-CTC 的扩展版本,其使用感兴趣的词表实现基于 BERT 的 E2E-ASR。BECTRA 是一种基于转导器的模型,其编码器采用 BERT-CTC,并使用适合目标任务的词表训练特定于 ASR 的解码器。结合转导器与 BERT-CTC,我们还提出了一种新颖的推理算法,以兼顾自回归与非自回归解码的优势。在多个 ASR 任务(数据量、说话风格与语言各异)上的实验结果表明,BECTRA 通过有效处理词表不匹配并利用 BERT 知识,优于 BERT-CTC。

关键词

引用

@article{arxiv.2211.00792,
  title  = {BECTRA: Transducer-based End-to-End ASR with BERT-Enhanced Encoder},
  author = {Yosuke Higuchi and Tetsuji Ogawa and Tetsunori Kobayashi and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2211.00792},
  year   = {2023}
}

备注

Accepted to ICASSP2023