中文

大规模语言模型重打分在竞争性 ASR 系统上的效果与分析

计算与语言 2022-08-19 v2 声音 音频与语音处理

摘要

大规模语言模型(LLMs)如 GPT-2、BERT 和 RoBERTa 已成功应用于 ASR N-best 重打分。然而,它们是否能或如何惠及具有竞争力、接近最先进水平的 ASR 系统仍未被探索。在本研究中,我们将 LLM 重打分引入最具竞争力的 ASR 基线之一:Conformer-Transducer 模型。我们证明了 LLM 的双向性、预训练、领域内微调和上下文增强均带来了一致的改进。此外,我们的词汇分析阐明了这些组成部分各自可能如何促进 ASR 性能。

关键词

引用

@article{arxiv.2204.00212,
  title  = {Effect and Analysis of Large-scale Language Model Rescoring on Competitive ASR Systems},
  author = {Takuma Udagawa and Masayuki Suzuki and Gakuto Kurata and Nobuyasu Itoh and George Saon},
  journal= {arXiv preprint arXiv:2204.00212},
  year   = {2022}
}

备注

Accepted to Interspeech 2022