中文

用文本转语音合成语音测试用例?自动化语音识别测试中的误报实证研究

软件工程 2023-07-20 v3

摘要

近期研究提出使用文本转语音(Text-To-Speech, TTS)系统自动大规模合成语音测试用例,并揭示出自动语音识别(ASR)系统中大量失败案例。然而,合成测试用例所揭示的失败可能并不能反映 ASR 系统在转写人类音频时的实际性能,我们称之为误报。给定一个由 TTS 系统合成的失败测试用例(由 TTS 生成的音频及相应真实文本组成),我们将表述相同文本的人类音频输入 ASR 系统。若人类音频可被正确转写,则检测到一个误报实例。在本研究中,我们利用四个 TTS 系统生成的合成音频和两个常用数据集获取的人类音频,调查了五个流行 ASR 系统中的误报发生情况。结果表明,测试 Deepspeech 时识别出的误报数最少,测试 Wav2vec2 时误报数最高。平均而言,五个 ASR 系统的误报率在 21% 至 34% 之间。在所用的 TTS 系统中,Google TTS 产生的误报最少(17%),Espeak TTS 在四个 TTS 系统中产生最多误报(32%)。此外,我们构建了一个误报估计器来标记潜在误报,取得了令人满意的结果:精确率 98.3%、召回率 96.4%、准确率 98.5%、F1 分数 97.3%。本研究为选择合适 TTS 系统生成高质量语音以测试 ASR 系统提供了见解。此外,误报估计器可作为减小误报影响并帮助开发人员在评估 ASR 系统时选择合适测试输入的一种途径。本文所用源代码已在 GitHub 公开:https://github.com/julianyonghao/FAinASRtest。

关键词

引用

@article{arxiv.2305.17445,
  title  = {Synthesizing Speech Test Cases with Text-to-Speech? An Empirical Study on the False Alarms in Automated Speech Recognition Testing},
  author = {Julia Kaiwen Lau and Kelvin Kai Wen Kong and Julian Hao Yong and Per Hoong Tan and Zhou Yang and Zi Qian Yong and Joshua Chern Wey Low and Chun Yong Chong and Mei Kuan Lim and David Lo},
  journal= {arXiv preprint arXiv:2305.17445},
  year   = {2023}
}

备注

13 pages, Accepted at ISSTA2023