中文

面向加重说话人语音的医学实体高性能 ASR 模型

音频与语音处理 2024-06-19 v1 计算与语言 声音

摘要

近期自动语音识别(ASR)在医疗领域取得了显著进展,但其在加重说话人语音中的医学命名实体(Named Entity, NE)表现,如药物名称、诊断和实验室结果,尚未得到广泛了解。我们对多个 ASR 模型在 93 种非洲方言的临床英文数据集上进行了严格评估。我们的分析显示,尽管一些模型实现了较低的总体词错误率(Word Error Rate, WER),但在临床实体上的错误率更高,这可能对患者安全构成实质性风险。为实证说明这一点,我们从转录文本中提取临床实体,开发了一种新算法来对齐 ASR 预测与这些实体,计算医学 NE Recall、医学 WER 和字符错误率。我们的结果表明,针对加重说话人语音进行微调可显著改善医学 WER(相对提升 25-34%),显著提升其在医疗环境中的实际适用性。

关键词

引用

@article{arxiv.2406.12387,
  title  = {Performant ASR Models for Medical Entities in Accented Speech},
  author = {Tejumade Afonja and Tobi Olatunji and Sewade Ogun and Naome A. Etori and Abraham Owodunni and Moshood Yekini},
  journal= {arXiv preprint arXiv:2406.12387},
  year   = {2024}
}

备注

Accepted at Interspeech 2024