ASTER:面向口吃者的自动语音识别系统无障碍测试
声音
2023-08-31 v1 人工智能
软件工程
音频与语音处理
摘要
如今自动语音识别(ASR)系统的普及导致对其无障碍性的需求日益增长。处理口吃语音是无障碍 ASR 系统的一项重要特性。为改善 ASR 系统对口吃者的无障碍性,我们需要暴露并分析 ASR 系统在口吃语音上的失败。从口吃者录制的语音数据集多样性不足,难以暴露大多数失败。此外,这些数据集缺乏关于非口吃文本的 ground truth 信息,使其不适合作为全面的测试套件。因此,需要一种生成口吃语音作为测试输入以测试和分析 ASR 系统性能的方法。然而,在此场景下生成有效测试输入具有挑战性。原因是生成的测试输入虽应模仿口吃者说话方式,又需足够多样以触发更多失败。为应对该挑战,我们提出 ASTER,一种自动测试 ASR 系统无障碍性的技术。ASTER 可通过注入五种不同的口吃类型来生成有效测试用例。所生成的测试用例既能模拟真实口吃语音,又能暴露 ASR 系统中的失败。此外,ASTER 还能通过基于多目标优化的种子更新算法进一步提升测试用例质量。我们将 ASTER 实现为一个框架,并在四个开源 ASR 模型和三个商业 ASR 系统上进行了评估。我们对抗 ASTER 进行了全面评估,发现其显著提高了所评估 ASR 系统的词错误率、匹配错误率和词信息损失。另外,我们的用户研究表明,生成的口吃音频与真实世界的口吃音频片段难以区分。
引用
@article{arxiv.2308.15742,
title = {ASTER: Automatic Speech Recognition System Accessibility Testing for Stutterers},
author = {Yi Liu and Yuekang Li and Gelei Deng and Felix Juefei-Xu and Yao Du and Cen Zhang and Chengwei Liu and Yeting Li and Lei Ma and Yang Liu},
journal= {arXiv preprint arXiv:2308.15742},
year = {2023}
}