中文

语音测试用例优先级排序

软件工程 2023-02-02 v1

摘要

随着自动语音识别(ASR)系统的广泛采用,对 ASR 系统进行测试与改进日益重要。然而,收集和执行语音测试用例通常昂贵且耗时,这促使我们策略性地对语音测试用例进行优先级排序。一个关键问题是:如何确定收集和执行语音测试用例的理想顺序,以尽早发现更多错误?每个语音测试用例由一段音频及相应参考文本组成。本工作中,我们提出 PROPHET(PRiOritizing sPeecH tEsT),一种仅基于参考文本预测潜在可揭示错误的语音测试用例的工具。因此,PROPHET 无需运行 ASR 系统即可分析测试用例并排序,从而能够大规模分析语音测试用例。我们在 3 个 ASR 系统和 12 个数据集上评估了 6 种不同的优先级排序方法。在相同的测试预算下,我们发现该方法比最先进的方法多揭示 12.63% 的误识词。我们从优先级列表中选取测试用例微调 ASR 系统,并分析我们的方法如何提升 ASR 系统性能。统计检验表明,相较于现有基线方法,我们提出的方法能为 ASR 系统带来显著更大的性能提升。此外,我们进行相关性分析并确认:使用模型表现较差的数据集微调 ASR 系统,往往能带来更大的性能提升。

关键词

引用

@article{arxiv.2302.00330,
  title  = {Prioritizing Speech Test Cases},
  author = {Zhou Yang and Jieke Shi and Muhammad Hilmi Asyrofi and Bowen Xu and Xin Zhou and DongGyun Han and David Lo},
  journal= {arXiv preprint arXiv:2302.00330},
  year   = {2023}
}