从反馈到检查清单:AI生成临床笔记质量评估的扎实评估
计算与语言
2025-10-10 v2 人工智能
摘要
AI生成的临床笔记在医疗保健领域日益增多地被使用,但由于主观性高且专家评审的可扩展性有限,评估其质量仍然是一个挑战。现有的自动化指标常常无法与真实世界中医生的偏好相吻合。为此,我们提出了一个系统性地将真实用户反馈提炼为结构化检查清单用于笔记评估的管道。这些检查清单旨在具有可解释性,基于人类反馈,并能被基于大语言模型的评估器执行。我们使用来自部署于AI医学书记系统的21,000多例脱敏临床案例数据,显示我们的方法从反馈中提炼的检查清单在覆盖范围、多样性以及对人类评级的预测能力方面,优于基准方法。在离线评估中,大量实验确认了该检查清单对质量降低扰动的鲁棒性,以及与临床医生偏好的显著一致性,并在实际评估方法中显示出实际价值。在离线研究环境中,我们的检查清单为识别可能不符合定义质量标准的笔记提供了实用的工具。
引用
@article{arxiv.2507.17717,
title = {From Feedback to Checklists: Grounded Evaluation of AI-Generated Clinical Notes},
author = {Karen Zhou and John Giorgi and Pranav Mani and Peng Xu and Davis Liang and Chenhao Tan},
journal= {arXiv preprint arXiv:2507.17717},
year = {2025}
}
备注
Accepted to EMNLP 2025 Industry Track