中文

自动化言语测听:使用开源预训练Kaldi-NL自动语音识别能否可行?

计算与语言 2024-03-18 v2 声音 音频与语音处理

摘要

一种实用的言语测听工具是用于不同年龄和听力状态人群听力筛查的噪声中数字(DIN)测试。该测试通常由人类主管(例如临床医生)进行,其对听者说出的反应进行评分,或者在线进行,由软件对听者输入的反应进行评分。该测试在自适应阶梯程序中呈现24个数字三元组,从而得出言语接收阈值(SRT)。我们提出了一种替代的自动化DIN测试设置,该设置可以在没有人类主管的情况下进行,同时评估口头反应,使用开源自动语音识别工具包Kaldi-NL。三十名自我报告听力正常的荷兰成年人(19-64岁)完成了一次DIN+Kaldi-NL测试。他们的口头反应被记录下来,并用于评估Kaldi-NL解码反应的转录。研究1通过词错误率(WER)评估了Kaldi-NL的性能,WER是指转录中仅关于数字的解码错误总和占口头反应中存在的数字总数的百分比。参与者的平均WER为5.0%(范围0 - 48%,SD = 8.8%),每位参与者平均在三个三元组中出现解码错误。研究2使用自助法模拟分析了带有Kaldi-NL解码错误的三元组对DIN测试输出(SRT)的影响。先前的研究表明,0.70 dB是听力正常成年人典型的受试者内SRT变异性。研究2表明,最多四个带有解码错误的三元组产生的SRT变化在此范围内,这表明我们提出的设置可能适用于临床应用。

关键词

引用

@article{arxiv.2312.12269,
  title  = {Automated speech audiometry: Can it work using open-source pre-trained Kaldi-NL automatic speech recognition?},
  author = {Gloria Araiza-Illan and Luke Meyer and Khiet P. Truong and Deniz Baskent},
  journal= {arXiv preprint arXiv:2312.12269},
  year   = {2024}
}

备注

25 pages (double spaced), 5 figures, 3 tables, 54 references