中文

赋能医疗从业者的大语言模型:在两类真实临床应用中结构化语音转录文本

计算与语言 2026-02-13 v3 人工智能

摘要

诸如 GPT-4o 和 o1 之类的大语言模型(LLMs)在多个医学基准上的临床自然语言处理(NLP)任务中已展现出强大性能。然而,两项具有重要影响的 NLP 任务——从护士口述生成结构化表格报告,以及从医患对话中提取医嘱——由于数据稀缺和敏感性,尽管业界积极投入,仍未得到充分探索。这些真实临床任务的实用解决方案可显著减轻医务工作者的文书负担,使其能更专注于患者照护。本文利用私有和开源临床数据集研究这两项具有挑战性的任务,评估开源与闭源权重 LLM 的表现,并分析其各自的优势与局限。此外,我们提出一种智能体(agentic)流水线,用于生成逼真且非敏感的护士口述内容,从而实现临床观察的结构化提取。为支持这两个领域的进一步研究,我们发布了 SYNUR 和 SIMORD——首个用于护士观察提取和医嘱提取的开源数据集。

关键词

引用

@article{arxiv.2507.05517,
  title  = {Empowering Healthcare Practitioners with Language Models: Structuring Speech Transcripts in Two Real-World Clinical Applications},
  author = {Jean-Philippe Corbeil and Asma Ben Abacha and George Michalopoulos and Phillip Swazinna and Miguel Del-Agua and Jerome Tremblay and Akila Jeeson Daniel and Cari Bader and Yu-Cheng Cho and Pooja Krishnan and Nathan Bodenstab and Thomas Lin and Wenxuan Teng and Francois Beaulieu and Paul Vozila},
  journal= {arXiv preprint arXiv:2507.05517},
  year   = {2026}
}