中文

基于 Deep Transformer 与子词单元的形态丰富在线 ASR 数据增强

音频与语音处理 2020-11-05 v3 计算与语言

摘要

近来 Deep Transformer 模型已被证明在 ASR 的语言建模任务中尤为强大。然而其高复杂度使其很难应用于在线系统的第一(单)遍。近期研究表明,神经网络语言模型 (LM) 的相当一部分知识可通过基于神经文本生成的数据增强迁移到传统 n-gram。在本文中,我们在通用文本语料库上预训练 GPT-2 Transformer LM,并在匈牙利对话呼叫中心 ASR 任务上微调。我们表明,尽管 Transformer 生成文本的数据增强对孤立语效果良好,但在形态丰富语言中会导致词汇爆炸。因此,我们提出一种称为基于子词的神经文本增强新方法,将生成文本重新切分为统计导出的子词。我们比较了 Morfessor 和 BPE 统计子词分词器,表明两种方法均能在大幅减小词汇量和内存需求的同时显著改善 WER。最后,我们还证明基于子词的神经文本增强不仅在整体 WER 上,也在 OOV 词识别上均优于基于词的方法。

关键词

引用

@article{arxiv.2007.06949,
  title  = {Deep Transformer based Data Augmentation with Subword Units for Morphologically Rich Online ASR},
  author = {Balázs Tarján and György Szaszák and Tibor Fegyó and Péter Mihajlik},
  journal= {arXiv preprint arXiv:2007.06949},
  year   = {2020}
}

备注

7 pages, 4 figures