利用自然语言处理与多波自适应抽样辅助的图表审查流程:加速大型数据库研究中基于代码算法的验证
计算与语言
2025-08-01 v1 统计方法学
摘要
背景:通过验证用于识别特定健康结果或其他关键研究参数的基于代码算法的测量特征,可提升大型索赔数据库分析的质量。这些指标可用于量化偏差分析,以评估给定潜在因结果误分类而产生的偏差对推论研究结果鲁棒性的影响。然而,通常需要大量时间和资源才能通过对链接电子健康记录中自由文本笔记进行手动图表审查来创建参考标准标签。方法:我们描述了一个加速的过程,通过两种独立机制提高验证研究的效率:1)利用自然语言处理(NLP)减少人类审阅者审阅每个图表的时间;2)采用预定义准则的多波自适应抽样方法,一旦性能特征以足够精确地被识别,即停止验证研究。我们以一个案例研究说明此过程,用于验证肥胖患者中意图自伤结果算法的性能。结果:我们实证性地表明,NLP辅助的标注过程使图表审阅时间缩短了 40%,使用预定义的停止规则进行多波抽样可避免审阅 77% 的患者图表,而对测量特征的精确度影响有限。结论:这种方法可以促进更常规的对用于定义关键研究参数的基于代码算法进行验证,最终增进对数据库研究发现可靠性的理解。
引用
@article{arxiv.2507.22943,
title = {A chart review process aided by natural language processing and multi-wave adaptive sampling to expedite validation of code-based algorithms for large database studies},
author = {Shirley V Wang and Georg Hahn and Sushama Kattinakere Sreedhara and Mufaddal Mahesri and Haritha S. Pillai and Rajendra Aldis and Joyce Lii and Sarah K. Dutcher and Rhoda Eniafe and Jamal T. Jones and Keewan Kim and Jiwei He and Hana Lee and Sengwee Toh and Rishi J Desai and Jie Yang},
journal= {arXiv preprint arXiv:2507.22943},
year = {2025}
}