中文

DANCER:用于自动语音识别的实体描述增强命名实体纠正器

计算与语言 2024-04-12 v3

摘要

端到端自动语音识别(E2E ASR)系统常常会误转录领域特定术语,如命名实体,甚至导致下游任务出现灾难性错误。近期有研究提出了一类快速轻量级的命名实体纠正(NEC)模型,这些模型通常基于语音级别的编辑距离算法,并展现了令人印象深刻的 NEC 性能。然而,随着命名实体(NE)列表的增长,语音混淆问题将加剧;例如,同音歧义将大幅增加。在此基础上,我们提出了一种 novel 的 Description Augmented Named entity CorrEctoR(暂称 DANCER),该模型利用实体描述提供额外信息,以帮助缓解 ASR 上下文中语音混淆问题。为此,我们引入一种高效的实体描述增强掩码语言模型(EDA-MLM),其中包含一个稠密检索模型,使其能够快速适应特定领域的实体以适应 NEC 任务。我们在 AISHELL-1 和 Homophone 数据集上进行的一系列实验确认了该建模方法的有效性。DANCER 在 AISHELL-1 数据集上对于命名实体的字错率(CER)相较于强基准模型——基于语音编辑距离的 NEC 模型(PED-NEC)——降低约7%。更值得注意的是,在包含高度语音混淆命名实体的 Homophone 数据集上测试时,DANCER 对于命名实体的 CER 相较于 PED-NEC 降低约46%。

关键词

引用

@article{arxiv.2403.17645,
  title  = {DANCER: Entity Description Augmented Named Entity Corrector for Automatic Speech Recognition},
  author = {Yi-Cheng Wang and Hsin-Wei Wang and Bi-Cheng Yan and Chi-Han Lin and Berlin Chen},
  journal= {arXiv preprint arXiv:2403.17645},
  year   = {2024}
}

备注

Accepted by LREC-COLING 2024