中文

基于分层Transformer的大上下文端到端ASR及大上下文知识蒸馏

计算与语言 2021-02-17 v1 机器学习

摘要

我们提出了一种新颖的大上下文端到端自动语音识别(E2E-ASR)模型及其基于知识蒸馏的有效训练方法。常见的E2E-ASR模型主要关注语句级处理,即每条语句被独立转写。另一方面,考虑语句边界之外长距离序列上下文的大上下文E2E-ASR模型,能很好地处理话语和对话等语句序列。然而,近期在语句级ASR系统中取得最优ASR性能的transformer架构尚未被引入大上下文ASR系统。我们预期transformer架构不仅可有效捕获输入语音上下文,也能捕获语句边界之外的长距离序列上下文。因此,本文提出一种分层transformer基的大上下文E2E-ASR模型,将transformer架构与基于分层编码器-解码器的大上下文建模相结合。此外,为使所提模型能利用长距离序列上下文,我们还提出一种大上下文知识蒸馏,在训练阶段从预训练的大上下文语言模型蒸馏知识。我们在日语话语ASR任务上评估了所提模型与训练方法的有效性。

关键词

引用

@article{arxiv.2102.07935,
  title  = {Hierarchical Transformer-based Large-Context End-to-end ASR with Large-Context Knowledge Distillation},
  author = {Ryo Masumura and Naoki Makishima and Mana Ihori and Akihiko Takashima and Tomohiro Tanaka and Shota Orihashi},
  journal= {arXiv preprint arXiv:2102.07935},
  year   = {2021}
}

备注

Accepted at ICASSP 2021