中文

N-best T5:利用多输入假设与约束解码空间的鲁棒ASR错误纠正

计算与语言 2023-10-11 v3 声音 音频与语音处理

摘要

错误纠正模型是自动语音识别(ASR)后处理的重要组成部分,用于提升转录文本的可读性和质量。大多数先前工作使用1-best ASR假设作为输入,因此只能利用单句内的上下文进行纠正。本工作中,我们提出了一种新颖的N-best T5模型用于该任务,其由T5模型微调而来,并利用ASR N-best列表作为模型输入。通过从预训练语言模型迁移知识并从ASR解码空间获取更丰富信息,所提方法优于强大的Conformer-Transducer基线。标准错误纠正的另一个问题是生成过程缺乏良好引导。为此,采用了基于N-best列表或ASR词格的约束解码过程,从而允许传播额外信息。

关键词

引用

@article{arxiv.2303.00456,
  title  = {N-best T5: Robust ASR Error Correction using Multiple Input Hypotheses and Constrained Decoding Space},
  author = {Rao Ma and Mark J. F. Gales and Kate M. Knill and Mengjie Qian},
  journal= {arXiv preprint arXiv:2303.00456},
  year   = {2023}
}

备注

Proceedings of INTERSPEECH