中文

混合 ASR 系统中改善代表性不足命名实体识别的方法

音频与语音处理 2020-05-19 v1 计算与语言 声音

摘要

在本文中,我们提出一系列互补方法,以在不损害整体词错误率性能的前提下,改善混合 ASR(自动语音识别)系统中代表性不足命名实体(NE)的识别。代表性不足的词语对应于训练数据中的稀有词或集外词(OOV),因此无法被可靠建模。我们首先采用字位词典,从而免去混合 ASR 中对语音模型的需求。我们在不同设置下研究它,并展示其在处理代表性不足 NE 方面的有效性。接下来,我们研究具有基于字母特征(为处理低频词而导出)的神经语言模型(LM)的影响。此后,我们尝试通过借用丰富表示词的嵌入表示来丰富预训练神经 LM 中代表性不足 NE 的表示。这使我们获得了代表性不足 NE 识别上的显著性能提升。最后,我们在由神经 LM 重打分的词格中提升含 NE 语句的似然分数,并进一步获得性能提升。上述方法的组合使 NE 识别相对提升高达 42%。

关键词

引用

@article{arxiv.2005.08742,
  title  = {Approaches to Improving Recognition of Underrepresented Named Entities in Hybrid ASR Systems},
  author = {Tingzhi Mao and Yerbolat Khassanov and Van Tung Pham and Haihua Xu and Hao Huang and Eng Siong Chng},
  journal= {arXiv preprint arXiv:2005.08742},
  year   = {2020}
}