中文

从含噪音频转录文本中提取生物医学实体

计算与语言 2024-03-27 v1

摘要

自动语音识别(ASR)技术是将口语转录为文本的基础,在临床领域有广泛应用,包括简化医疗转录以及与电子健康档案(EHR)系统集成。然而,挑战依然存在,尤其是当转录文本包含噪声时,会导致自然语言处理(NLP)模型应用时性能显著下降。命名实体识别(NER)作为一项关键的临床任务,尤其受此类噪声影响,这通常被称为 ASR-NLP 差距。先前的工作主要研究了 ASR 在干净录音中的效率,留下了关于噪声环境下性能的研究空白。本文引入了一个新颖的数据集 BioASR-NER,旨在弥合生物医学领域的 ASR-NLP 差距,重点关注从成人认知电话简短测试(BTACT)中提取药物不良反应和实体提及。我们的数据集提供了近 2000 条干净和含噪录音的全面集合。为解决噪声挑战,我们提出了一种使用 GPT4 的创新转录文本清理方法,研究了零样本和少样本方法。我们的研究进一步深入进行了错误分析,揭示了转录软件中的错误类型、GPT4 的纠正情况以及 GPT4 面临的挑战。本文旨在促进对 ASR-NLP 差距的更好理解和潜在解决方案,最终支持改进的医疗文档实践。

关键词

引用

@article{arxiv.2403.17363,
  title  = {Extracting Biomedical Entities from Noisy Audio Transcripts},
  author = {Nima Ebadi and Kellen Morgan and Adrian Tan and Billy Linares and Sheri Osborn and Emma Majors and Jeremy Davis and Anthony Rios},
  journal= {arXiv preprint arXiv:2403.17363},
  year   = {2024}
}

备注

Accepted to LREC-COLING 2024