中文

ML-DQA的开发和验证——面向医疗的机器学习数据质量保证框架

机器学习 2022-08-05 v1 机器学习

摘要

机器学习界与临床研究界利用真实世界数据(RWD,包括电子健康记录(EHR)中捕获的数据)的方式存在显著差异。临床研究人员谨慎地将 RWD 用于临床研究,而医疗机器学习团队则极少审查便使用公共数据集来开发新算法。本研究通过开发和验证 ML-DQA(一种基于 RWD 最佳实践的数据质量保证框架)来弥合这一差距。ML-DQA 框架被应用于跨越两个地域、不同病症和不同队列的五个 ML 项目。在五个项目所收集的 247,536 名患者的 RWD 上,共生成 2,999 项质量检查和 24 份质量报告。由此浮现出五项可推广的实践:所有项目均使用类似方法对冗余数据元素表示进行分组;所有项目均使用自动化工具构建诊断和用药数据元素;所有项目均使用基于规则的转换通用库;所有项目均使用统一方法将数据质量检查分配至数据元素;所有项目均使用类似的临床裁定方法。每个项目实施 ML-DQA 平均涉及 5.8 名人员(包括临床医生、数据科学家和受训人员),且每个项目平均有 23.4 个数据元素因 ML-DQA 而被转换或移除。本研究展示了 ML-DQA 在医疗项目中的重要作用,并为团队开展这些必要活动提供了框架。

关键词

引用

@article{arxiv.2208.02670,
  title  = {Development and Validation of ML-DQA -- a Machine Learning Data Quality Assurance Framework for Healthcare},
  author = {Mark Sendak and Gaurav Sirdeshmukh and Timothy Ochoa and Hayley Premo and Linda Tang and Kira Niederhoffer and Sarah Reed and Kaivalya Deshpande and Emily Sterrett and Melissa Bauer and Laurie Snyder and Afreen Shariff and David Whellan and Jeffrey Riggio and David Gaieski and Kristin Corey and Megan Richards and Michael Gao and Marshall Nichols and Bradley Heintze and William Knechtle and William Ratliff and Suresh Balu},
  journal= {arXiv preprint arXiv:2208.02670},
  year   = {2022}
}

备注

Presented at 2022 Machine Learning in Health Care Conference