评估 AI 生成临床笔记的质量:大型语言模型记者的验证性评估
计算与语言
2025-05-26 v1 人工智能
摘要
美国各地医疗机构开始采纳生成式人工智能工具以执行医书员的职能,以减轻临床记录负担。尽管其应用广泛,但尚无成熟方法衡量 AI 记者的质量。为填补这一空白,我们开展了盲法研究,比较大型语言模型(LLM)生成的临床笔记与领域专家编写的笔记的相对表现。基于 Physician Documentation Quality Instrument(PDQI9)的定量指标为评估笔记质量提供了框架,我们据此适配评估 AI 生成笔记的相对表现。跨越 5 个医学专科的临床专家使用 PDQI9 工具评估专家撰写的 Gold 笔记和 LLM 作者的 Ambient 笔记。每位专科有两位评估者对来自 97 例患者就诊的笔记进行评分。我们发现,在一般内科、骨科和妇产科普遍存在 RWG 大于 0.7 的评估者间高度一致性,在儿科和心脏科则表现为中等(RWG 0.5 到 0.7)至高水平。我们发现,Gold 笔记得分 4.25(满分 5 分),而 Ambient 笔记得分 4.20 分(p = 0.04),差异虽小但显著。我们的发现支持将 PDQI9 工具作为衡量 LLM 作者笔记质量的实用方法,与人类编写的笔记相比较。
引用
@article{arxiv.2505.17047,
title = {Assessing the Quality of AI-Generated Clinical Notes: A Validated Evaluation of a Large Language Model Scribe},
author = {Erin Palm and Astrit Manikantan and Mark E. Pepin and Herprit Mahal and Srikanth Subramanya Belwadi},
journal= {arXiv preprint arXiv:2505.17047},
year = {2025}
}
备注
15 pages, 5 tables, 1 figure. Submitted for peer review 05/15/2025