面向自动语音识别系统的神经零膨胀质量估计模型
计算与语言
2020-09-01 v2 声音
音频与语音处理
摘要
自动语音识别(ASR)系统的性能通常在提供人工转写数据时以词错误率(WER)指标进行评估,然而在实际场景中此类数据获取成本高昂。此外,大多数 ASR 系统的 WER 经验分布往往倾向于在零附近聚集显著概率质量,难以用单一连续分布进行模拟。为解决 ASR 质量估计(QE)的两个问题,我们提出一种新颖的神经零膨胀模型,以在无转写文本情况下预测 ASR 结果的 WER。我们设计了一种基于语音特征条件双向 transformer 语言模型(speech-BERT)之上的神经零膨胀 beta 回归。我们亦采用词元级掩码语言建模的预训练策略训练 speech-BERT,并利用我们的零膨胀层对离散与连续混合输出进行进一步微调。实验结果表明,相较于大多数已有的 ASR 或机器翻译质量估计算法,我们的方法在 Pearson 与 MAE 指标上的 WER 预测性能更优。
引用
@article{arxiv.1910.01289,
title = {Neural Zero-Inflated Quality Estimation Model For Automatic Speech Recognition System},
author = {Kai Fan and Jiayi Wang and Bo Li and Shiliang Zhang and Boxing Chen and Niyu Ge and Zhijie Yan},
journal= {arXiv preprint arXiv:1910.01289},
year = {2020}
}
备注
InterSpeech 2020