中文

基于合成数据和语义纠正的高精度医学语音识别:UNITED-MEDASR

音频与语音处理 2024-12-03 v1 计算与语言 声音

摘要

临床领域的自动语音识别(ASR)系统面临着需准确识别专业医学词汇且满足严格精度要求等挑战。我们引入United-MedASR,这是一种新型架构,通过集成合成数据生成、精确ASR微调和先进的语义增强技术来解决这些挑战。United-MedASR通过合成来自ICD-10(国际疾病分类第10版)、MIMS(医学专科月索引)以及FDA数据库等权威来源的数据,构建专用的医学词汇表。该丰富的词汇表帮助微调Whisper ASR模型以更好地满足临床需求。为提高处理速度,我们采用Faster Whisper,确保流畅且高速的ASR性能。此外,我们采用基于BART的定制语义增强器来处理复杂的医学术语,从而有效提高准确率。我们的分层方法在ASR性能方面树立了新的基准, 在 LibriSpeech test-clean 上实现0.985%的词错误率(WER),在Europarl-ASR EN Guest-test 上实现0.26%的WER, 并在Tedlium(0.29% WER)和FLEURS(0.336% WER)上表现出稳健的性能。Furthermore, 我们提出一种可复制的可适应架构,可跨越不同领域,成为面向特定领域ASR系统的通用解决方案。

关键词

引用

@article{arxiv.2412.00055,
  title  = {High-precision medical speech recognition through synthetic data and semantic correction: UNITED-MEDASR},
  author = {Sourav Banerjee and Ayushi Agarwal and Promila Ghosh},
  journal= {arXiv preprint arXiv:2412.00055},
  year   = {2024}
}

备注

15 pages