中文

利用补充文本数据在有限转写条件下启动自动语音识别系统开发

计算与语言 2023-02-13 v1

摘要

近期使用预训练 transformer 模型的研究表明,仅 10 分钟转写语音或许足以微调此类模型用于自动语音识别(ASR)——至少在我们还能利用海量文本数据(803 million tokens)的情况下。但真的需要那么多文本数据吗?我们研究了使用不同规模的文本数据:一方面用于构建约束 ASR 解码至可能词表的词典(如 *dogz 与 dogs),另一方面用于训练更大的语言模型以将系统偏向可能的词序列(如 too dogs 与 two dogs)。我们使用来自英语的 10 分钟转写语音(用于复现先前工作)以及两对补充文本数据可用性不同的语言进行实验:Gronings 和 Frisian(约 7.5M token 语料可用),以及 Besemah 和 Nasal(仅有小型词典可用)。对于所有语言,我们发现仅使用词典并未显著改善 ASR 性能。对于 Gronings 和 Frisian,我们发现源自“小说长度”80k token 子语料的词典和语言模型将词错误率(WER)平均降至 39%。我们的发现表明,在可获得数万 token 或更多文本语料的情况下,仅用数十分钟转写语音微调 transformer 模型,有望获得接近 30% WER 经验法则的可由人工校正转写。

关键词

引用

@article{arxiv.2302.04975,
  title  = {Leveraging supplementary text data to kick-start automatic speech recognition system development with limited transcriptions},
  author = {Nay San and Martijn Bartelds and Blaine Billings and Ella de Falco and Hendi Feriza and Johan Safri and Wawan Sahrozi and Ben Foley and Bradley McDonnell and Dan Jurafsky},
  journal= {arXiv preprint arXiv:2302.04975},
  year   = {2023}
}

备注

Accepted for ComputEL-6