大规模语言模型重打分在竞争性 ASR 系统上的效果与分析
计算与语言
2022-08-19 v2 声音
音频与语音处理
摘要
大规模语言模型(LLMs)如 GPT-2、BERT 和 RoBERTa 已成功应用于 ASR N-best 重打分。然而,它们是否能或如何惠及具有竞争力、接近最先进水平的 ASR 系统仍未被探索。在本研究中,我们将 LLM 重打分引入最具竞争力的 ASR 基线之一:Conformer-Transducer 模型。我们证明了 LLM 的双向性、预训练、领域内微调和上下文增强均带来了一致的改进。此外,我们的词汇分析阐明了这些组成部分各自可能如何促进 ASR 性能。
引用
@article{arxiv.2204.00212,
title = {Effect and Analysis of Large-scale Language Model Rescoring on Competitive ASR Systems},
author = {Takuma Udagawa and Masayuki Suzuki and Gakuto Kurata and Nobuyasu Itoh and George Saon},
journal= {arXiv preprint arXiv:2204.00212},
year = {2022}
}
备注
Accepted to Interspeech 2022