中文

用于端到端语音识别的反向语言模型迭代浅融合

音频与语音处理 2023-12-22 v1 计算与语言

摘要

我们提出一种新的浅融合(SF)方法,以利用外部反向语言模型(BLM)用于端到端自动语音识别(ASR)。BLM 与正向语言模型(FLM)具有互补特性,并且它们组合的有效性已通过作为后处理对 ASR 假设进行重打分得到证实。在所提出的 SF 中,我们在解码过程中以反向(即从可能的下一个词元到起始符号)将 BLM 迭代应用于部分 ASR 假设,并用新计算的 BLM 分数替换上一次迭代计算的分数为。为增强该迭代 SF(ISF)的有效性,我们使用包含部分句子的反转文本数据训练一个部分句子感知的 BLM(PBLM),以考虑 ISF 的框架。在使用基于注意力的编码器-解码器 ASR 系统的实验中,我们确认使用 PBLM 的 ISF 表现出与使用 FLM 的 SF 相当的性能。通过执行 ISF,可在解码期间防止对前瞻假设的过早剪枝,并且相较于将 PBLM 作为后处理应用,我们可获得性能提升。最后,我们确认通过结合 SF 与 ISF,得益于 FLM 与 PBLM 的互补性,可取得进一步的性能提升。

关键词

引用

@article{arxiv.2310.11010,
  title  = {Iterative Shallow Fusion of Backward Language Model for End-to-End Speech Recognition},
  author = {Atsunori Ogawa and Takafumi Moriya and Naoyuki Kamo and Naohiro Tawara and Marc Delcroix},
  journal= {arXiv preprint arXiv:2310.11010},
  year   = {2023}
}

备注

Accepted to ICASSP 2023