确保经筛选的 EHR 衍生数据的可靠性:LLM/ML 提取信息与数据准确性验证(VALID)框架
机器学习
2025-06-11 v1 人工智能
性能
摘要
大型语言模型(LLM)正越来越多地被用于从电子健康记录(EHR)中提取临床数据,为肿瘤学中真实世界数据(RWD)的筛选提供了可扩展性和效率方面的显著提升。然而,LLM 的采用在确保提取数据的可靠性、准确性和公平性方面引入了新的挑战,而这些对于研究、监管和临床应用至关重要。现有的 RWD 和人工智能质量保证框架未能完全解决与 LLM 提取数据相关的独特错误模式和复杂性。在本文中,我们提出了一个全面的框架,用于评估 LLM 提取的临床数据的质量。该框架集成了针对专家人工摘录的变量级性能基准测试、用于内部一致性和合理性的自动化验证检查,以及将 LLM 提取的数据与人工摘录的数据集或外部标准进行比较的重复性分析。这种多维方法能够识别最需要改进的变量,系统性地检测潜在错误,并确认数据集在真实世界研究中的适用性。此外,该框架通过按人口统计学亚组对指标进行分层来支持偏差评估。通过提供一种严格且透明的方法来评估 LLM 提取的 RWD,该框架推进了行业标准,并支持在肿瘤学研究和实践中可信地使用 AI 驱动的证据生成。
引用
@article{arxiv.2506.08231,
title = {Ensuring Reliability of Curated EHR-Derived Data: The Validation of Accuracy for LLM/ML-Extracted Information and Data (VALID) Framework},
author = {Melissa Estevez and Nisha Singh and Lauren Dyson and Blythe Adamson and Qianyu Yuan and Megan W. Hildner and Erin Fidyk and Olive Mbah and Farhad Khan and Kathi Seidl-Rathkopf and Aaron B. Cohen},
journal= {arXiv preprint arXiv:2506.08231},
year = {2025}
}
备注
18 pages, 3 tables, 1 figure