中文

指导疟疾诊断机器学习算法开发的评估指标

机器学习 2023-07-06 v2

摘要

自动化疟疾诊断对机器学习(ML)而言是一个困难但高价值的目标,有效的算法可以挽救数以万计儿童的生命。然而,当前的 ML 工作很大程度上忽视了关键的使用场景约束,因此不具备临床实用性。有两个因素对开发可转化到临床现场环境的算法尤为关键:(i)清楚理解 ML 解决方案必须适应的临床需求;以及(ii)用于指导和评估 ML 模型的任务相关指标。忽视这些因素严重阻碍了以往疟疾的 ML 工作,因为其得到的算法与临床需求不一致。在本文中,我们在通过吉姆萨染色血涂片显微镜进行自动化疟疾诊断的背景下解决这两个问题。首先,我们描述为何领域专业知识对有效将 ML 应用于疟疾至关重要,并列出提供该领域知识的技术文档和其他资源。其次,我们详述为疟疾诊断临床要求定制的性能指标,以通过临床需求(而非通用 ML 视角)的透镜指导 ML 模型开发并评估模型性能。我们强调患者级视角、患者间变异性、假阳性率、检测限以及不同类型错误的重要性。我们还讨论了在 ML 工作中常用的 ROC 曲线、AUC 和 F1 为何在此背景下不太适用的原因。这些发现也适用于其他涉及寄生虫负荷的疾病,包括被忽视的热带病(NTDs)如血吸虫病。

关键词

引用

@article{arxiv.2209.06947,
  title  = {Metrics to guide development of machine learning algorithms for malaria diagnosis},
  author = {Charles B. Delahunt and Noni Gachuhi and Matthew P. Horning},
  journal= {arXiv preprint arXiv:2209.06947},
  year   = {2023}
}

备注

17 pages, 5 figures