中文

面向 AI 起草患者门户消息的检索增强护栏:错误分类体系构建与大规模评估

计算与语言 2025-09-29 v1 人工智能 信息检索

摘要

通过 EHR 门户进行的异步患者-临床医生消息传递正日益增加临床医生的工作量,引发了人们对使用大语言模型 (LLMs) 辅助起草回复的兴趣。然而,LLM 的输出可能包含临床不准确、遗漏或语气不匹配,这使得稳健的评估变得至关重要。我们的贡献有三个方面: 我们引入了一个基于临床的错误分类体系,包含 5 个领域和 59 个细粒度错误代码,该体系是通过归纳编码和专家裁定开发的; 我们开发了一个检索增强评估管线 (RAEC),利用语义相似的历史消息-回复对来提高判断质量; 我们提供了一种使用 DSPy 的两阶段提示架构,以实现可扩展、可解释且分层的错误检测。我们的方法既独立评估草稿质量,也参考从机构档案中检索到的类似历史消息-回复对进行评估。使用两阶段 DSPy 管线,我们在超过 1,500 条患者消息上比较了基线评估和参考增强评估。检索上下文改善了在临床完整性和工作流适当性等领域的错误识别。对 100 条消息的人工验证表明,上下文增强标签相比基线具有更好的一致性(一致性 = 50% vs. 33%)和性能(F1 = 0.500 vs. 0.256),支持将我们的 RAEC 管线作为患者消息的 AI 护栏。

关键词

引用

@article{arxiv.2509.22565,
  title  = {Retrieval-Augmented Guardrails for AI-Drafted Patient-Portal Messages: Error Taxonomy Construction and Large-Scale Evaluation},
  author = {Wenyuan Chen and Fateme Nateghi Haredasht and Kameron C. Black and Francois Grolleau and Emily Alsentzer and Jonathan H. Chen and Stephen P. Ma},
  journal= {arXiv preprint arXiv:2509.22565},
  year   = {2025}
}