中文

基于分块自助法的 ASR 性能统计检验

机器学习 2020-05-22 v2 机器学习 音频与语音处理

摘要

在自动语音识别(ASR)评估中一个常见的问题是,比较两个 ASR 系统时观测到的词错误率(WER)提升有多可靠,其中统计假设检验和置信区间(CI)可用于判断该提升是真实的还是仅由随机偶然造成。自助重采样方法因直观且易用于此类显著性分析而广受欢迎。然而,该方法在处理相关数据时失效,而相关数据在语音领域十分普遍——例如,同一说话人语句上的 ASR 性能可能相关。本文提出分块自助法(blockwise bootstrap)——通过将评估语句划分为不重叠的块,该方法对这些块而非原始数据进行重采样。我们证明了在温和条件下,两个 ASR 系统间绝对 WER 差异所得的方差估计量是一致的。我们还在合成与真实世界语音数据上展示了分块自助法的有效性。

关键词

引用

@article{arxiv.1912.09508,
  title  = {Statistical Testing on ASR Performance via Blockwise Bootstrap},
  author = {Zhe Liu and Fuchun Peng},
  journal= {arXiv preprint arXiv:1912.09508},
  year   = {2020}
}

备注

6 pages, 2 figures