中文

利用混合生成伪转录克服低资源序列到序列ASR模型的领域失配

计算与语言 2021-06-16 v1 声音 音频与语音处理

摘要

当存在大量训练数据时,序列到序列(seq2seq)模型在自动语音识别(ASR)任务上与混合模型具有竞争力。然而,数据稀疏与领域自适应对 seq2seq 模型而言比对其混合模型对应物更为棘手。我们考察了来自 IARPA MATERIAL 项目的五种语言语料库,其中转录数据为会话电话语音(CTS),而评估数据为广播新闻(BN)。我们表明,在此类数据条件下,混合模型与 seq2seq 模型之间存在可观的初始差距,且混合模型能够借助额外的语言模型(LM)数据得到进一步改进。我们使用一组主要来自 BN 领域的无转录数据来进行半监督训练。在半监督训练中,在转录数据上训练的种子模型为无标签的领域匹配数据生成假设转录文本以用于进一步训练。通过使用具有扩展语言模型的混合模型进行伪转录,我们能够将 seq2seq 模型在所有五种语言上的平均词错误率(WER)从 66.7% 提升至 29.0% WER。虽然这使 seq2seq 模型处于一个有竞争力的运行点,混合模型仍能够利用额外的 LM 数据保持优势。

关键词

引用

@article{arxiv.2106.07716,
  title  = {Overcoming Domain Mismatch in Low Resource Sequence-to-Sequence ASR Models using Hybrid Generated Pseudotranscripts},
  author = {Chak-Fai Li and Francis Keith and William Hartmann and Matthew Snover and Owen Kimball},
  journal= {arXiv preprint arXiv:2106.07716},
  year   = {2021}
}

备注

5 pages