通过置信度估计构建可信的电子健康档案智能体
人工智能
2025-08-27 v1
摘要
大语言模型(LLM)在从电子健康档案(EHR)中提取信息和支持临床决策方面展现出潜力。然而,由于存在幻觉风险,其在临床环境中的部署面临挑战。我们提出了幻觉控制精度@k%(HCAcc@k%),这是一个量化在不同置信度阈值下精度与可靠性权衡的新指标。我们引入了 TrustEHRAgent,这是一个具有置信度感知能力的智能体,它结合了逐步置信度估计用于临床问答。在 MIMIC-III 和 eICU 数据集上的实验表明,在严格的可靠性约束下,TrustEHRAgent 优于基线方法,在 HCAcc@70% 下分别实现了 44.23 个百分点和 25.34 个百分点的提升,而基线方法在这些阈值下则失效。这些结果凸显了传统精度指标在评估医疗 AI 智能体时的局限性。我们的工作有助于开发可信的临床智能体,使其能够提供准确信息,或在置信度低时透明地表达不确定性。
引用
@article{arxiv.2508.19096,
title = {Trustworthy Agents for Electronic Health Records through Confidence Estimation},
author = {Yongwoo Song and Minbyul Jeong and Mujeen Sung},
journal= {arXiv preprint arXiv:2508.19096},
year = {2025}
}