面向临床医生的 EHR 嵌入式 AI 代理的端到端评估与治理
人工智能
2026-05-01 v1
摘要
临床 AI 系统不仅需要进行点状评估,还需要持续的治理:即在部署期间持续监控、评估、迭代和重新评估性能。我们提出了一种端到端的治理框架,将 Rubric 验证、现场部署反馈、技术性能监控和成本跟踪集成在一起,并通过受控实验对系统变更进行部署前的管控。应用于 Hyperscribe,这是一个嵌入式 EHR 的代理,将环境音转换为结构化图表更新。二十位临床医生为 1,646 项验证 Rubric 编写了 823 个案例。通过受控实验评估了七个 Hyperscribe 版本,中位数得分从 84% 提升至 95%。分析 107 条现场反馈条目(跨三个月),显示反馈构成从 79% 错误报告和 14% 正面观察转变为 30% 错误和 45% 正面观察,表明工程干预已解决了故障。音频段的中位数处理时间为 8.1 秒,经过重试机制吸收瞬时模型错误后,有效完成率达 99.6%。这些结果表明,对已部署临床 AI 的持续、多通道治理是可行且有效的。
引用
@article{arxiv.2604.27309,
title = {End-to-End Evaluation and Governance of an EHR-Embedded AI Agent for Clinicians},
author = {Aaryan Shah and Andrew Hines and Alexia Downs and Denis Bajet and Paulius Mui and Fabiano Araujo and Laura Offutt and Aida Rutledge and Elizabeth Jimenez},
journal= {arXiv preprint arXiv:2604.27309},
year = {2026}
}
备注
19 pages, 6 figures, 6 tables, submitted to npj Digital Medicine