中文

用于序列到序列 ASR 系统语言模型偏置的上下文密度比方法

音频与语音处理 2022-06-30 v1 人工智能

摘要

端到端(E2E)模型因性能与优势在一些 ASR 任务中日益流行。这些 E2E 模型直接近似给定声学输入下词符的后验分布。因此,E2E 系统在输出词符上隐式定义了一个语言模型(LM),这使得独立训练语言模型的利用不如传统 ASR 系统直接。这使得难以将 E2E ASR 系统动态适配到上下文轮廓以更好地识别专有名词等特殊词。在本工作中,我们提出一种上下文密度比方法,用于训练上下文感知的 E2E 模型并将语言模型适配到专有名词。我们将上述技术应用于一个转写医患对话的 E2E ASR 系统,以更好地使 E2E 系统适配对话中的人名。我们提出的技术在名字上相对 E2E 基线取得了最高 46.5% 的相对提升,且不降低整个测试集的整体识别准确率。此外,它还以 22.1% 的相对值超越了上下文浅融合基线。

关键词

引用

@article{arxiv.2206.14623,
  title  = {Contextual Density Ratio for Language Model Biasing of Sequence to Sequence ASR Systems},
  author = {Jesús Andrés-Ferrer and Dario Albesano and Puming Zhan and Paul Vozila},
  journal= {arXiv preprint arXiv:2206.14623},
  year   = {2022}
}

备注

Interspeech 2021 (draft)