中文

一种实用的多领域语音识别框架及面向神经语言建模的实例采样方法

音频与语音处理 2022-03-10 v1 声音

摘要

智能手机或车载设备中使用的自动语音识别 (ASR) 系统通常需处理来自差异极大的领域的语音查询。在此类情形下,普通 ASR 系统通常难以在每个领域都表现良好。本文提出一种面向腾讯地图(一款用于智能手机与车载信息娱乐系统的导航应用)的多领域 ASR 框架。该框架由三个核心部分组成:生成语音查询 n-best 列表的基础 ASR 模块、判定语音查询所属领域的文本分类模块,以及利用领域特定语言模型对 n-best 列表重新打分的重排序模块。此外,提出一种基于实例采样的神经网络语言模型 (NNLMs) 训练方法,以解决多领域 ASR 中的数据不平衡问题。实验中,因导航与播放音乐是腾讯地图的两大主要功能,所提框架在导航领域与音乐领域进行了评估。相较于通用 ASR 系统,所提框架在腾讯地图及我们的车载语音助手采集的多个测试集上实现了 13% \sim 22% 的相对字符错误率下降。

关键词

引用

@article{arxiv.2203.04767,
  title  = {A practical framework for multi-domain speech recognition and an instance sampling method to neural language modeling},
  author = {Yike Zhang and Xiaobing Feng and Yi Liu and Songjun Cao and Long Ma},
  journal= {arXiv preprint arXiv:2203.04767},
  year   = {2022}
}

备注

7 pages, 1 figure