中文

面向 ASR 系统融合的自动质量估计

计算与语言 2017-06-23 v1

摘要

识别器输出投票误差减少(ROVER)已被广泛用于自动语音识别(ASR)中的系统融合。为了在输出转录文本的每个位置选择最合适的插入词,一些 ROVER 扩展依赖于置信度分数和其他 ASR 解码器特征等关键信息。这些信息并非总是可用,高度依赖于解码过程,且有时倾向于高估已识别词的真实质量。本文提出了一种新颖的 ROVER 变体,它利用 ASR 质量估计(QE)在“片段级别”对转录文本进行排序,而不是:i) 依赖置信度分数,或 ii) 向 ROVER 提供随机排序的假设。我们首先引入一组有效的特征来弥补 ASR 解码器信息的缺失。然后,我们应用 QE 技术在融合过程开始前进行准确的片段级假设排序。评估在两个不同的任务上进行,分别融合来自独立 ASR 系统和多麦克风录音的假设。在这两个任务中,均假设 ASR 解码器信息不可用。所提出的方法显著优于标准 ROVER,并且与两个利用了待融合假设真实质量先验知识的强预言机具有竞争力。与标准 ROVER 相比,两个评估场景中的绝对词错误率改进范围从 0.5% 到 7.3%。

关键词

引用

@article{arxiv.1706.07238,
  title  = {Automatic Quality Estimation for ASR System Combination},
  author = {Shahab Jalalvand and Matteo Negri and Daniele Falavigna and Marco Matassoni and Marco Turchi},
  journal= {arXiv preprint arXiv:1706.07238},
  year   = {2017}
}