中文

利用地理模型提升本地兴趣点的语音识别准确率

音频与语音处理 2021-07-08 v1 声音

摘要

如今,针对兴趣点(POI)的语音搜索正变得越来越流行。然而,由于方言多样和POI数量庞大,本地POI的语音识别仍然是一项挑战。本文从两个方面提升了本地POI的语音识别准确率。首先,提出了一种地理声学模型(Geo-AM)。该Geo-AM利用方言特定输入特征和方言特定顶层来处理多方言问题。其次,一组地理特定语言模型(Geo-LM)被集成到我们的语音识别系统中,以提升长尾和同音POI的识别准确率。在解码过程中,根据用户地理位置按需选择特定的语言模型。实验表明,所提出的Geo-AM在口音测试集上实现了6.5%∼10.1%的相对字错率(CER)降低,而所提出的Geo-AM与Geo-LM在腾讯地图任务上总共实现了超过18.7%的相对CER降低。

关键词

引用

@article{arxiv.2107.03165,
  title  = {Improving Speech Recognition Accuracy of Local POI Using Geographical Models},
  author = {Songjun Cao and Yike Zhang and Xiaobing Feng and Long Ma},
  journal= {arXiv preprint arXiv:2107.03165},
  year   = {2021}
}

备注

Accepted by SLT 2021