医学笔记中错误检测提示优化的重要性
计算与语言
2026-02-27 v1 人工智能
摘要
医学文本中的错误可能导致就诊延误,甚至导致错误治疗。最近,大语言模型在自动检测医学文本错误方面显示出前景,这一能力有望显著惠及医疗系统。在本文中,我们探讨了在错误检测任务中,对小型和大型语言模型进行提示优化的重要性。我们进行了严格的实验和分析,涵盖前沿语言模型和开源语言模型。我们表明,自动提示优化使用 Genetic-Pareto (GEPA) 可将 GPT-5 上错误检测的基线准确率从 0.669 提升到 0.785,将 Qwen3-32B 上从 0.578 提升到 0.690,接近医生水平,并在 MEDEC 基准数据集上实现了最新成果。代码已在 GitHub 上提供:https://github.com/CraigMyles/clinical-note-error-detection
引用
@article{arxiv.2602.22483,
title = {Importance of Prompt Optimisation for Error Detection in Medical Notes Using Language Models},
author = {Craig Myles and Patrick Schrempf and David Harris-Birtill},
journal= {arXiv preprint arXiv:2602.22483},
year = {2026}
}
备注
Accepted at EACL HeaLing 2026