中文

MedAlign:一个由临床医生生成的用于电子病历指令遵循的数据集

计算与语言 2023-12-27 v2 人工智能 机器学习

摘要

大语言模型 (LLMs) 以人类水平的流畅度遵循自然语言指令的能力,为医疗领域减少行政负担和改善护理质量提供了诸多机会。然而,在医疗现实文本生成任务上评估 LLMs 仍具挑战。现有的电子健康记录 (EHR) 数据问答数据集未能捕捉临床医生所面临的信息需求复杂性与文档负担。为应对这些挑战,我们引入 MedAlign,一个包含 983 条 EHR 数据自然语言指令的基准数据集。MedAlign 由 15 名临床医生(7 个专科)整理,包含针对 303 条指令的临床医生撰写参考回复,并提供 276 份纵向 EHR 用于支撑指令-回复对。我们使用 MedAlign 评估了 6 个通用领域 LLMs,由临床医生对每个 LLM 回复的准确性和质量排序。我们发现错误率较高,从 35% (GPT-4) 到 68% (MPT-7B-Instruct) 不等,且 GPT-4 上下文长度从 32k 降至 2k 时准确率下降 8.3%。最后,我们报告了临床医生排序与自动化自然语言生成指标之间的相关性,以此作为无需人工评审即可对 LLMs 排序的方法。我们在研究数据使用协议下提供 MedAlign,以支持针对临床医生需求与偏好任务上的 LLM 评估。

关键词

引用

@article{arxiv.2308.14089,
  title  = {MedAlign: A Clinician-Generated Dataset for Instruction Following with Electronic Medical Records},
  author = {Scott L. Fleming and Alejandro Lozano and William J. Haberkorn and Jenelle A. Jindal and Eduardo P. Reis and Rahul Thapa and Louis Blankemeier and Julian Z. Genkins and Ethan Steinberg and Ashwin Nayak and Birju S. Patel and Chia-Chun Chiang and Alison Callahan and Zepeng Huo and Sergios Gatidis and Scott J. Adams and Oluseyi Fayanju and Shreya J. Shah and Thomas Savage and Ethan Goh and Akshay S. Chaudhari and Nima Aghaeepour and Christopher Sharp and Michael A. Pfeffer and Percy Liang and Jonathan H. Chen and Keith E. Morse and Emma P. Brunskill and Jason A. Fries and Nigam H. Shah},
  journal= {arXiv preprint arXiv:2308.14089},
  year   = {2023}
}