MEDEC:临床笔记中的医学错误检测与纠正基准
摘要
多项研究表明,大型语言模型(Large Language Model, LLM)能够正确回答医学问题,在某些医学考试中甚至超越平均人类水平。然而,据我们所知,尚无研究评估了语言模型验证现有或生成医学文本正确性和一致性的能力。本文介绍MEDEC(https://github.com/abachaa/MEDEC),这是第一个公开的用于临床笔记医学错误检测与纠正的基准测试,涵盖五类错误(诊断、管理、治疗、药物治疗和病因微生物)。MEDEC包含3,848个临床文本,其中488个来自三家美国医院系统的临床记录,这些记录此前未被任何LLM见过。该数据集已用于MEDIQA-CORR共享任务,以评估十七个参赛系统[Ben Abacha 等,2024]。本文描述了数据创建方法,并评估了近期LLM(如o1-preview、GPT-4、Claude 3.5 Sonnet和Gemini 2.0 Flash)在检测和纠正需要医学知识和推理能力的医学错误方面的任务。我们还对比研究了两位医生在MEDEC测试集上执行相同任务的结果。结果表明,MEDEC是一个足够具有挑战性的基准测试,能够评估模型验证现有或生成记录的正确性并纠正医学错误的能力。我们也发现,尽管近期LLM在错误检测和纠正方面表现良好,但仍被医生超越。在本实验中,我们讨论了导致这一差距的潜在因素、实验中的见解、当前评估指标的局限性,并分享了未来研究的潜在指引。
引用
@article{arxiv.2412.19260,
title = {MEDEC: A Benchmark for Medical Error Detection and Correction in Clinical Notes},
author = {Asma Ben Abacha and Wen-wai Yim and Yujuan Fu and Zhaoyi Sun and Meliha Yetisgen and Fei Xia and Thomas Lin},
journal= {arXiv preprint arXiv:2412.19260},
year = {2025}
}
备注
This version has been updated with further clarification regarding the model size estimates that were mined from public articles only and provided to aid in contextualizing model performance. The authors cannot vouch for the accuracy of those estimates