L2RS:一种用于自动语音识别的学习重打分机制
计算与语言
2019-10-28 v1 声音
音频与语音处理
摘要
现代自动语音识别(ASR)系统主要依赖声学模型(AM)和语言模型(LM)的得分来对 N-best 列表进行重打分。随着近期自然语言处理的大量进展,当前 ASR 用于评估 N-best 假设的语言和语义合法性的信息相当有限。在本文中,我们提出一种新颖的学习重打分(L2RS)机制,专门用于利用最先进 NLP 模型的各种文本信息,并自动决定其权重以对 ASR 系统的 N-best 列表进行重打分。具体而言,我们整合了包括 BERT 句子嵌入、主题向量以及由 n-gram LM、主题建模 LM、BERT LM 和 RNNLM 产生的困惑度得分等特征来训练重打分模型。我们基于一个公开数据集进行了大量实验,实验结果表明,L2RS 在 NDCG@10 指标上以 20.67% 的大幅提升优于传统重打分方法及其深度神经网络对应方法。L2RS 为开发更有效的 ASR 重打分模型铺平了道路。
引用
@article{arxiv.1910.11496,
title = {L2RS: A Learning-to-Rescore Mechanism for Automatic Speech Recognition},
author = {Yuanfeng Song and Di Jiang and Xuefang Zhao and Qian Xu and Raymond Chi-Wing Wong and Lixin Fan and Qiang Yang},
journal= {arXiv preprint arXiv:1910.11496},
year = {2019}
}
备注
5 pages, 3 figures