一种用于电子健康记录语义审计的生成式方法
机器学习
2026-05-26 v2
摘要
临床人工智能(AI)的可靠性依赖于高质量数据,然而电子健康记录往往与现有科学知识不一致。当前的质量评估存在局限性:它们要么关注语法,要么依赖劳动密集型的手动规则来捕获语义细微差别。为克服这些可扩展性障碍,我们提出了Medical Data Pecking,一种将软件单元测试原则应用于医学数据验证的方法。它引入了语义数据覆盖率,利用大语言模型生成上下文感知的测试,以“啄出”观测数据与流行病学证据之间的不一致性。为演示该方法,我们使用检索增强生成架构实现了一个参考工具,该工具将医学文献综合为可执行代码。当应用于三个数据集时,该实现为每个队列生成了数十个测试,识别出观测分布与流行病学先验之间的差异。这些差异既包括真实的数据不一致性,也包括预期的队列选择效应。这项工作为可扩展的语义审计提供了一个初步框架,将保证从手动规则转向可信赖AI所需的生成式和上下文敏感的验证。
引用
@article{arxiv.2507.02628,
title = {A Generative Approach for Semantic Auditing of Electronic Health Records},
author = {Irena Girshovitz and Atai Ambus and Moni Shahar and Ran Gilad-Bachrach},
journal= {arXiv preprint arXiv:2507.02628},
year = {2026}
}
备注
23 pages, 5 figures (+ appendix)